AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Kuvittelen, että 1500$/kk riittää ihan hyvin kuukaudeksi. Tarkoittanee tosin sitä, että tehdään yhtä taskia kerrallaan ja unelmat jostain x-agenttia jauhaa taustalla 24/7 ei toteudu.
Noin 8 dollaria käyttöä per tunti, ei paljoa xhighiä huudateta. En ihmettelisi jos tuo rajoitus johtaa parempaan softaan, joutuu vähän miettimään mitä tekee yolottelun sijaan.

No ei heti, mutta onko täällä henkilöitä, jotka on teettäneet kaikki koodit AI:lla edes muutaman kuukauden? Itse ainakin olen huomannut että jopa rajoitetusti käytettynä alkaa detskut unohtua. Katselmointi onnistuu, kun kyllähän sen lukea osaa, mutta itse kun koodaa niin pitää alkaa kaivella dokumentaatiota, että mitenkäs ne parametrit nyt annettiinkaan?
Ei kai se sen kummempi kuin vähän pidemmältä lomalta hommiin palaaminen, pari päivää saattaa olla ruosteessa ja taas sujuu. Eipä nuo vuosia/vuosikymmeniä toistetut asiat kovin helpolla (jos ikinä) unohdu. Agenttien kanssa on sentään sen softan kanssa tekemisissä, väittisin ehkä jopa, että olen muuttunut paremmaksi koodaajaksi, vaikka en käsin juuri mitään enää teekään, kun oppinut agentteja seuraamalla lukuisia kikkoja.
 
Ei kai se sen kummempi kuin vähän pidemmältä lomalta hommiin palaaminen, pari päivää saattaa olla ruosteessa ja taas sujuu. Eipä nuo vuosia/vuosikymmeniä toistetut asiat kovin helpolla (jos ikinä) unohdu. Agenttien kanssa on sentään sen softan kanssa tekemisissä, väittisin ehkä jopa, että olen muuttunut paremmaksi koodaajaksi, vaikka en käsin juuri mitään enää teekään, kun oppinut agentteja seuraamalla lukuisia kikkoja.
Varmaan sekin, että jää enempi aikaa miettiä isoja palasia, arkkitehtuuria yms. kun ei mene aika yksikkötestien naputteluun tai muuhun mekaaniseen työhön.

Arvelen, että ai-koodaus johtaa alkuvaikeuksien jälkeen vähäisempään teknisen velan määrään. Lähes triviaali refaktoroida ja pitää arkkitehtuuri tiukkana kun muutosten tekeminen, testien päivittäminen yms. helppoa ja halpaa.
 
No ei heti, mutta onko täällä henkilöitä, jotka on teettäneet kaikki koodit AI:lla edes muutaman kuukauden? Itse ainakin olen huomannut että jopa rajoitetusti käytettynä alkaa detskut unohtua. Katselmointi onnistuu, kun kyllähän sen lukea osaa, mutta itse kun koodaa niin pitää alkaa kaivella dokumentaatiota, että mitenkäs ne parametrit nyt annettiinkaan?
C#, Visual Studio ja IntelliSense.
 
Ompa meidänki firmassa vähän lämmetty AI:lle, jopa minullekin nyt kevyesti hakusassa firman kustantama github copilot (missä ei esim ole eded gpt 5.5 vaan vanhempia). Kaikkee sitä, uskon sitten kun jos tuollasen joskus saan.
Kiertää vaan niin monen mutkan kautta ulkomailta tuollanen hakemus että tiedäppä heruuko.
 
Viimeksi muokattu:
Ompa meidänki firmassa vähän lämmetty AI:lle, jopa minullekin nyt kevyesti hakusassa firman kustantama github copilot (missä ei esim ole eded gpt 5.5 vaan vanhempia). Kaikkee sitä, uskon sitten kun jos tuollasen joskus saan.
Kiertää vaan niin monen mutkan kautta ulkomailta tuollanen että tiedäppä heruuko.
Vaikea nähdä useissa tapauksissa mikä lisäuhka esim. microsoftin copilotin kanssa olis kun firmoissa kuitenkin teams, outlook, win11, office, sharepoint, zoom, slack jne. Tai sitten samat googlelta. Toisinaan vielä joku github/gitlab/jira/linear tms. pilvestä. Hyvin tuntuu argumentit koodausavustimien kanssa samanlaisilta kuin miksi ei pilveä ja onprem, mutta silti pilvi ja pilvipalvelut osoittaituivat menestykseksi.

Nvidian tapauksessa vielä kun next gen vera-rubin:ssa data ja laskenta saadaan kaikkien palikoiden osalta suoritettua salattuna niin ei voi jostain väylästä tai muistista edes varastaa selkokielistä dataa tai koodia: NVIDIA Confidential Computing

Toiselta puolelta googlella on serfifioitua pilveä pankki, amerikan armeija yms. käyttöön. Jos noille kelpaa niin vaikea nähdä miksi ei kelpaisi useimmille suomalaisillekin firmoille. Toki nämä EU jutut, että konesalit pitäisi olla EU:n alueella kun poliittinen tahto on pitää eurooppalaisten data euroopassa.
 
Viimeksi muokattu:
Tämmöisessä idioottimoodissa en ole ennen nähnyt Codexia, piti ihan katsoa onko jenkeissä työaika. Yrittänyt tehdä simppelin UI kuvasta & tarkasta suunnitelmasta, joka sujuu yleensä 1-2 promptilla maaliin ja nyt ei tule yhtään mitään, keksii jatkuvasti jonkin keinon laiskotella tai ymmärtää väärin. Paras oli, kun keksi ratkaisuksi liimata kuvan ohjelman päälle, sen kielsin ja pian keksi, että kuvan voi leikata osiin ja liimata päälle niin ei ole muka sama asia ja ilmoitti ylpeänä, että nyt on 100% vastaavuus. Tiedustelin miten tulokseen päästiin ja vastauksena tuli "huijasin pilkkomalla kuvan osiin, poistanko sen ja teen oikeasti?", wtf.

Nämä ~10 promptia maksoi
1780612512651.png
ja juuri mitään ei saatu aikaan, kyllä olisi verenpaine korkealla jos ei olisi ilmaisia kredittejä.
 
Tämmöisessä idioottimoodissa en ole ennen nähnyt Codexia, piti ihan katsoa onko jenkeissä työaika. Yrittänyt tehdä simppelin UI kuvasta & tarkasta suunnitelmasta, joka sujuu yleensä 1-2 promptilla maaliin ja nyt ei tule yhtään mitään, keksii jatkuvasti jonkin keinon laiskotella tai ymmärtää väärin. Paras oli, kun keksi ratkaisuksi liimata kuvan ohjelman päälle, sen kielsin ja pian keksi, että kuvan voi leikata osiin ja liimata päälle niin ei ole muka sama asia ja ilmoitti ylpeänä, että nyt on 100% vastaavuus. Tiedustelin miten tulokseen päästiin ja vastauksena tuli "huijasin pilkkomalla kuvan osiin, poistanko sen ja teen oikeasti?", wtf.

Nämä ~10 promptia maksoi
1780612512651.png
ja juuri mitään ei saatu aikaan, kyllä olisi verenpaine korkealla jos ei olisi ilmaisia kredittejä.
Viikonloppu lähestyy ja porukka paineessa että sais edes sunnuntain vapaaksi. Voipi olla 5.6:sta myös tulossa ja sen takia konesalikapasiteetti kortilla. Kovasti huhua 5.6:sta. Anthropic puolella myös huhuillaan parempaa mallia olevan tulossa. Mielenkiintoinen kesäkuu tiedossa uusien mallien osalta.
 
Viikonloppu lähestyy ja porukka paineessa että sais edes sunnuntaina vapaaksi. Voipi olla 5.6:sta myös tulossa ja sen takia konesalikapasiteetti kortilla. Kovasti huhua 5.6:sta. Anthropic puolella myös huhuillaan parempaa mallia olevan tulossa. Mielenkiintoinen kesäkuu tiedossa uusien mallien osalta.
Hurjasti kyllä huhuja nyt. Pitää tällä kertaa muistaa toteuttaa projektien vaikeimmat osuudet äkkiä heti mallin tullessa, tuntuu, että äly on aina sen pari viikkoa tapissa, ennen kuin painavat lobotomianappia.
 
Kaikki huhumyllyt ja "diilit USA:n hallinnon kanssa" samaan aikaan näiden yhtiöiden pörssilistautumisen kanssa on varmasti ihan pelkkää sattumaa
 
Kuutelin jensen huangin gtc taipei financial analyst esityksen. Koodauksen kannalta oli mielenkiintoista kun jensen selitti, että haluavat siirtää agentit lokaalikoneelle. Lokaalikone delegoi pilveen sen mitä lokaalisti ei voi. Näin se varmaan kannattaisi tehdä sen sijaan, että kaikki on pilvessä. Sekä kustannusten että suorituskyvyn vuoksi lokaaliagentti parempi. Frameworkeista puhui hermeksestä, openshell yms. Huomenneet varmaan nvidiallakin, että tokeneihin menee hemmetisti rahaa niin ehkä satoja miljoonia syitä satsata lokaaliin,...

--

OpenAI painoi ohi anthropicista niin nyt huudellaan, että pitäs painaa pause nappia :)
1780658481201.png


--

15% käyttäjistä saanut bugin vuoksi enempi tokeneita. Korjanneet bugin ja nähtäneen kuka parahtaa kun tokenit kallistuivat
1780658583491.png
 
Viimeksi muokattu:
Anthropicin statistiikkaa heidän koodaushommista. Mielenkiintoista, että skippasivat sisäisesti koko 4.6:en... Ja sehän oli vain hetken aikaa hyvä ja sitten muuttui idiootiksi.

On se jonkinlainen etu kun anthropic voi käyttää parempia malleja kuin muut. Sama juttu varmaan openai:lla. Ei tarvi enää ihmetellä miksi se julkinen kaikkien saama palvelu voi olla silsaa ja firman sisällä saavat priimaa käyttää. Ehkä sama homma oikeasti isojen enterprise asiakkaiden kanssa tyyliin microsoft, nvidia jne.

1780658832341.png
 
Anthropicin statistiikkaa heidän koodaushommista. Mielenkiintoista, että skippasivat sisäisesti koko 4.6:en... Ja sehän oli vain hetken aikaa hyvä ja sitten muuttui idiootiksi.

On se jonkinlainen etu kun anthropic voi käyttää parempia malleja kuin muut. Sama juttu varmaan openai:lla. Ei tarvi enää ihmetellä miksi se julkinen kaikkien saama palvelu voi olla silsaa ja firman sisällä saavat priimaa käyttää. Ehkä sama homma oikeasti isojen enterprise asiakkaiden kanssa tyyliin microsoft, nvidia jne.

1780658832341.png
Mä jotenkin luulin että tää LoC-metriikkasekoilu olis lopetettu jo kauan aikaa sitten. Mutta ei sit vissiin.

Onhan sitä toki helppo mitata mutta ei se mitään kauhean järkevää mittaa.
 
Pistin läppäriin Hermes Desktop, siihen GPT 5.5 xhigh:lla. Läppärissä ssh-avaimet molempiin openwrt-reitittimiin. Tuumasin sille että käy tutkimassa konffit ja tee niistä itsellesi skillit, teki työtä käskettynä.
Sen jälkeen ohjeistin tekemään suunnitelman missä luovutaan ethernet backhaulista ja siirrytään joko 802.11s tai WDS langattomaan meshiin. Taas tuli ihan hyvät suunnitelmat ja suositus että WDS koska käytössä 2 reititintä ja enempää ei tule.

Vaiheittain ja hallitusti sitten siirtyi langattomaan backhauliin, mukana oli myös antennien suuntaustata että reitittimien välinen linkki parantui.

Tässä mitään tarvitse enää itse konffailla ellei halua. Tässä näin konffailemalla vaan ei myöskään itse opi mitään ja se ns. lapiohauis kuihtuu pois.
 
Mä jotenkin luulin että tää LoC-metriikkasekoilu olis lopetettu jo kauan aikaa sitten. Mutta ei sit vissiin.
Tuossa kaaviossa on mielenkiintoista se, että anthropic ei käyttänyt 4.6:sta ollenkaan sisäisesti. Koodimäärä räjähti kun mythos tuli heillä q1:lla käyttöön. Jos olisi pelkkää loc-sekoilua niin olis varmaan nuo koodimäärät räjähtäneet aikaisemmin. Jotain tuon mythoksen kyvykkyydessä on eri tavalla kuin 4.x malleissa mitä me saadaan pilvestä käyttöön.

Jos pitäisi arvella niin eivät varmaan enää kauheasti promptaile yks juttu kerrallaan vaan tekevät tikettejä mitä mythos-toteuttaa.
 
Pistin läppäriin Hermes Desktop, siihen GPT 5.5 xhigh:lla. Läppärissä ssh-avaimet molempiin openwrt-reitittimiin. Tuumasin sille että käy tutkimassa konffit ja tee niistä itsellesi skillit, teki työtä käskettynä.
Sen jälkeen ohjeistin tekemään suunnitelman missä luovutaan ethernet backhaulista ja siirrytään joko 802.11s tai WDS langattomaan meshiin. Taas tuli ihan hyvät suunnitelmat ja suositus että WDS koska käytössä 2 reititintä ja enempää ei tule.

Vaiheittain ja hallitusti sitten siirtyi langattomaan backhauliin, mukana oli myös antennien suuntaustata että reitittimien välinen linkki parantui.

Tässä mitään tarvitse enää itse konffailla ellei halua. Tässä näin konffailemalla vaan ei myöskään itse opi mitään ja se ns. lapiohauis kuihtuu pois.
Nvidia+MS näyttää win11:een puuhaavan häkkiä minkä sisään agentti. Hakevat varmaan ratkaisua missä "tavis" vois ajaa agenttia ja se ei vahingossa tuhoa mitään. Alkaa selviämään mikä toi dgx spark/rtx spark läppärit puskeminen on. Lienee sweet spot tulee olemaan 128GB muistilla oleva vekotin lokaaliagenttihommiin. Myyvät maksimit näitä koneita firmoihin muutaman vuoden sisään

--

Anthropicista. Huomionarvoista, että he käyttävät mythosta, eivät 4.x claudea mitä me voidaan käyttää. ts. iso ero kyvykkyydessä
More than 80% of the code merged into its production codebase as of last month was authored by Claude, up from low single digits before Claude Code reached research preview in February last year
On the hardest, least-specified coding tasks, Anthropic said Claude succeeded 76% of the time in May 2026, a rise of 50 percentage points in six months. A recurring internal test that asks each new model to make training code run faster saw results climb from roughly triple the original speed with Claude Opus 4 in May 2025 to about 52 times with the unreleased Mythos Preview model in April.
 
Kyllä nyt tulee isoja sanoja ja AGI varoituksia kun pörssilistautuminen lähestyy. Tää oli vähän linjasta poikkeava:
Internal data shows engineers shipping eight times more code.
no mitä helvettiä? Linkedinissä kaikki AI-konsultit puhuu 100x-1000x työtehosta. En lähde kyllä enää sijoittamaan
 
Kyllä nyt tulee isoja sanoja ja AGI varoituksia kun pörssilistautuminen lähestyy. Tää oli vähän linjasta poikkeava:

no mitä helvettiä? Linkedinissä kaikki AI-konsultit puhuu 100x-1000x työtehosta. En lähde kyllä enää sijoittamaan
Kuten toi edup sanoi niin ei koodirivimäärillä voi mitata työtehoa. Joskus 10 riviä on parempi kuin 100 riviä. Se oleellinen tän ketjun kannalta, että siinä missä vaikeimmista taskeista 6kk sitten 1/3:sta onnistui anthropicin sisäiseltä AI:lta niin nyt onnistu 3/4:sta.

Tämä on koodausavustinketju. Jos haluat IPO:sta, politiikasta yms. kirjoitella niin joku toinen ketju on parempi paikka. Tämä ketju on alueella "Ohjelmointi, pelikehitys ja muu sovelluskehitys"
 
Koodauksen kannalta oli mielenkiintoista kun jensen selitti, että haluavat siirtää agentit lokaalikoneelle. Lokaalikone delegoi pilveen sen mitä lokaalisti ei voi. Näin se varmaan kannattaisi tehdä sen sijaan, että kaikki on pilvessä.
Tekoälyfirmoille jo myyty maksimit, seuraavaksi kaupataan kuluttajille ja pikkufirmoille vähän edullisempia kortteja pikkumallien pyörittämiseen. :psmoke: Itseen ainakin toimisi tuo taktiikka, jos saisi "järkevään" hintaan kunnon kortin tai pari en voisi vastustaa ostamista.
 
Tekoälyfirmoille jo myyty maksimit, seuraavaksi kaupataan kuluttajille ja pikkufirmoille vähän edullisempia kortteja pikkumallien pyörittämiseen. :psmoke: Itseen ainakin toimisi tuo taktiikka, jos saisi "järkevään" hintaan kunnon kortin tai pari en voisi vastustaa ostamista.
Kyllähän toi paikallinen 128GB tms. muistillinen kone vois olla kova, kun ainakin perusjutut menis sit lokaalisti "hae se tiedosto missä", "commitoi muutokset" jne. Seuraava devaajan työkone on 128GB muistia + nopeahko apu. Sen mitä pystyy hoidetaan lokaalimallilla. Jos tuo toimii niin melkoinen päivityssykli edessä koodaus+toimistotyöntekijöiden työkoneissa. 2028 nvidia luvannut rtx rubin spark:in. Saa nähdä päivittyykö siinä kohtaa max muisti 256GB highend mallissa.

Nvidia taitaa olla isoin paja tekemään open source malleja. Epäilemättä ainakin yrittävät tehdä omalle raudallensa optimoidut agenttiset llm:t eri käyttöihin koodauksesta officeen. Osa nvidian malleista sellaisia, että opetusdata ja skriptitkin julkaistu niin voi helposti itse opettaa saman mallin/fine tunettaa oman firman datalla tms.

Nvidian uusin. Pienemmät mallit nemotron:sta tuli aikaisemmin tänä vuonna
1780662284763.png


 
Mä jotenkin luulin että tää LoC-metriikkasekoilu olis lopetettu jo kauan aikaa sitten. Mutta ei sit vissiin.

Onhan sitä toki helppo mitata mutta ei se mitään kauhean järkevää mittaa.
Ennen varmaankin olisin ollut samaa mieltä, tuo ajatus toimii vanhalla tyylillä, jossa voi kytätä koodia kuukauden ja optimoida rivejä pois, nykyaikana AI kanssa jos ei ole tullut paljoa lisää rivejä se kertoo vain, ettet ole saanut mitään aikaan. Pumppaan pelkkiin hupiprojekteihini kymmeniä/satoja tuhansia rivejä kuukaudessa, lähes kaikkiin niihin on vaatimuksena äärimmäinen suorituskyky ja oikein toimiva softa. Vaikka koodi olisi puhdasta paskaa onko sillä merkitystä, jos se toimii nopeasti ja oikein? Se on ainoa asia joka merkkaa bisnekselle.
 
Kertoo se silti miten isosta murroksesta on kyse.
Etenkin kun seuraa miten tuo koodimäärä ja kyvykkyys muuttuu aina kun tulee parempi malli tarjolle. sonnet4.5:lla ei vielä paljoa committeja tehty anthropic:in koodikannassa versus uusin mythos.

Vaikka miten vääntelis niin suunta on selvä. Poterossa voi vähän yrittää hidastaa menoa, mutta iso maailma menee ohi. Nopeet syö hitaiden lounaat.

--

Huvittavaa näissä, että "lokaali/open source riittää", sitten kun tulee suljettu oikeasti hyvä "ihan paskaa tekee, maailmanloppu tulee jos laitetaan ai-koodia versionhallintaan sisään". Olispa todella kiva päästä kokeileen uusin privaatti mythos, että millainen se oikeasti on. Ylläpidettävyyskin menee vähän eri prioriteettiin, kun jos tarvii muutoksia, vuoden, kahden, kolmen päästä niin koko paskan voi uudelleenkirjoituttaa kertaluokkaa paremmalla agenttisella työkalulla.
 
Anthropicin blogipostaus on kyllä hyvä. Kannattaa lukea. Eivät silottele, hyvin saa kiinni mitä on viimeisen parin vuoden ja etenkin viimeisen 6kk aikana tapahtunut.
There isn’t full consensus among staff at Anthropic, but many believe that the Claude-written code was still worse in quality than human-written code at Anthropic in late 2025, and is roughly at parity today. We expect it to be better within the year.
Proposed changes to our codebase are now read by an automated Claude reviewer that looks for bugs, security flaws, and other defects before it can merge. Using this tool, we ran a retrospective analysis, and found that an automated Claude review of every change to our codebase would have caught roughly a third of the bugs behind past incidents on claude.ai before they ever reached production. The engineers who wrote that code are among the best in the world at building these systems. Claude is now catching the mistakes that they missed.
“The comparative advantage of humans as of right now is still in seeing the bigger picture and thinking beyond the confines of the immediate task.”
 
Olispa todella kiva päästä kokeileen uusin privaatti mythos, että millainen se oikeasti on.
Mitähän OpenAI on? Antro on hyvä hypettämään, mutta 4.7, 4.8 flopanneet 5.5 vastaan. Pelottaa vähän, että OpenAI ottaa kunnon etumatkan ja sitten on käytännössä monopoli. 4.6 tänään käytin ja tuli vain mietittyä, että on kyllä järkyttävän hidas ja surkea esitys.
 
Mitähän OpenAI on? Antro on hyvä hypettämään, mutta 4.7, 4.8 flopanneet 5.5 vastaan. Pelottaa vähän, että OpenAI ottaa kunnon etumatkan ja sitten on käytännössä monopoli. 4.6 tänään käytin ja tuli vain mietittyä, että on kyllä järkyttävän hidas ja surkea esitys.
Vähän vaikuttaa siltä, että jakaudutaan kahden portaan väkeen. Ei 4.7 ja 4.8 ole distillointia enempää mythoksen kanssa tekemistä eikä niistä voi vetää johtopäätöksiä. Anthropicin omia statseja katsoo niin siellä eivät edes ole ottaneet 4.6-4.8 käyttöön, hyppäsivät suoraan 4.5->mythos. Selittää myös noita idioottimoodeja kun sitä tarjoillaan massalle. Mythos sisäisesti ja isojen asiakkaiden käytössä.

Mitä nyt kaislikosta kuullut, ei varmistettua niin anthropicin ja openai:n parhaat privaatit mitä muutama kymmenen isoa firmaa päässyt käyttämään on suurinpiirtein pariteetissa. Ei ole vielä havaittavissa sellaista, että jompi/kumpi karkais horisonttiin.
 
Ennen varmaankin olisin ollut samaa mieltä, tuo ajatus toimii vanhalla tyylillä, jossa voi kytätä koodia kuukauden ja optimoida rivejä pois, nykyaikana AI kanssa jos ei ole tullut paljoa lisää rivejä se kertoo vain, ettet ole saanut mitään aikaan. Pumppaan pelkkiin hupiprojekteihini kymmeniä/satoja tuhansia rivejä kuukaudessa, lähes kaikkiin niihin on vaatimuksena äärimmäinen suorituskyky ja oikein toimiva softa. Vaikka koodi olisi puhdasta paskaa onko sillä merkitystä, jos se toimii nopeasti ja oikein? Se on ainoa asia joka merkkaa bisnekselle.
Ainakaan itse en ikinä ole ollut suojatyöpaikassa missä saisi kuukausia optimoida rivejä pois. Päin vastoin, se sama tosiasia on pätenyt aiemminkin että bisnestä kiinnostaa vain se että softa toimii ja etenkin että siihen ilmestyy uusia fiitsuja vauhdittamaan myyntiä. Ja sitten aikataulupaineiden alla itsekin on joskus pitänyt suoltaa jotain roskaa mikä on ollut tarpeettoman pitkästi kirjoitettua ja hankalasti ylläpidettävää. Enkä varmasti ole ainoa.

Mä väitän että LLM:t (edes frontier-tasoiset) eivät ole muuttaneet sitä miksikään, että koodirivi on lähtökohtaisesti taakka (liability) ja että niiden määrää ei kannattaisi käyttää metriikkana. Vaikka miten hehkutetaan että jonkun moduulin voi sitten myöhemmin kirjoituttaa vielä paremmalla AI:lla uusiksi, on se silti aikaa (ja tokeneita=rahaa) polttava työ, mille bisnes pyörittelee silmiään kun se ei suoraan tuota jotain uutta näkyvää featurea softaan.
 
Mä väitän että LLM:t (edes frontier-tasoiset) eivät ole muuttaneet sitä miksikään, että koodirivi on lähtökohtaisesti taakka (liability)
Nyt kun tulee EU CRA, niin oma koodi vähentää taakkaa.

Jos käyttää kolmannen osapuolen kirjastoa, niin ei voi yhtään tietää miten hyvin se on tehty ja jos siihen tulee CVE niin siihen täytyy reagoida.

Jos tekee vastaavan itse AI:lla, niin voi toteuttaa vain juuri sen mitä tarvitsee. CVE-riski tulee olemaan huomattavasti pienempi kun kehittäjinä on pelkästään Claude ja Pekka, eikä puolta internettiä vaihtelevalla osaamisella.
 
Anthropicin blogipostaus on kyllä hyvä. Kannattaa lukea. Eivät silottele

IPO yritys ei silottele omaa tarinaansa kun pitäisi saada maksimaalinen määrä rahaa kovassa kilpailussa ja pian? Yep.

Ei 4.7 ja 4.8 ole distillointia enempää mythoksen kanssa tekemistä eikä niistä voi vetää johtopäätöksiä.

Pääteltynä mistä? Mythos ja Opus mitä todennäköisimmin ovat kummatkin samasta perusmallista jatkettuja, eikä niissä luultavasti edes ole mitään erityisiä tekniikoita jotka olisi jäänyt pois toisesta. Mallin koko voi olla eri, mutta loppujen lopuksi rahaa Anthropic haluaa tehdä ja tällä hetkellä IPO on se tärkein kohde. Sen takia mikä tahansa temppu joka heillä olisi OpenAI:ta vastaan tulisi varmasti käytettyä.

Todellinen temppu Mythoksessa toki on, että näin "salaisena" se on parempi mainos.

Aivan kuten Anthropic vähän aikaa sitten mainosti blogissaan että aikovat käyttää omia julkaistuja mallejaan enemmän Claude Coden kehityksessä [1]. Mikäli Mythos imee aivan samoja prompteja samalla tehokkuudella (toisin kuin melkein kaikki muut mallit, joissa eroja on nimenomaan nähtävissä), niin eroja Opukseen ei voi ihan hirveästi olla.

Mutta nopeasti kaikki unohtuu kun voisi taas hypettää uskomuksiaan.

[1] An update on recent Claude Code quality reports
 
IPO on se tärkein kohde
Tämä ja tuhat kertaa tämä. Tällä hetkellä ihan kaikkea Anthropicin viestintää kannattaa lukea sitä vasten, että niitä kirjoittaa tyypit, joista on tulossa vähintään miljonäärejä, useimmat vähintään monikymmenmiljoonäärejä ja osasta miljardöörejä. Sieltä ei tasan tule ulos yhtä ainutta riviä kommunikaatioita, joka voisi vaarantaa tämän. Sen sijaan kaikki mahdollinen hype käytetään.
 
There isn’t full consensus among staff at Anthropic, but many believe that the Claude-written code was still worse in quality than human-written code at Anthropic in late 2025, and is roughly at parity today. We expect it to be better within the year.
Selkeästi AI on tehnyt läpimurron tänä vuonna. Vuosi sitten puhuttiin koodausavustimista, kun nyt puhutaan automaattisesta koodauksesta.

Valitettavasti meidänkin firmassa on jääty jo pahasti jälkeen. Kilpailijat työntävät ulos tekoälyavustajia, meillä vasta suunnitellaan. Codexia meidän firmassa käyttää vain minä ja sekin vain siksi että olin riittävän röyhkeä hankkimaan siihen erikseen luvan. Suuri osa ei käytä mitään ja osa käyttää Codexia tai Claudea omalla kustannuksellaan.
 
Jahas, Claudella idioottimoodi. Tekee asioita pyytämättä ja päin persettä ja koko ajan saa olla korjaamassa.
 
On tuolla high ja xhigh intelligencellä selvä ero.

1780860085296.png

Joo kiva, mut pitäisi Amigaa pystyä emuloimaan myös ilman jittiä :redface: Olen aika varma että xhigh tasolla se olisi ymmärtänyt jutun juonen.
 
Yksi selvä puute tekoälyssä on: ne eivät ymmärrä riittävästi kontekstia.

AUDxPER oli nyt toista kertaa ongelma. AI lukee hyvin Hardware Reference Manualia ja toteuttaa sen mukaisesti, mutta ei ymmärrä että se ei ole ehdoton totuus hardware-emulaatiossa. HRM sanoo että periodin pitäisi olla vähintään 124, joten AI toteutti emulaation sen mukaisesti: rekisterissä pitää olla vähintään 124. Jos kirjoittaa pienemmän arvon, niin hw-emulaattori laittaa tilalle 124.

HW-emulaatio ei kuitenkaan toimi niin ja rekistereihin täytyy saada kirjoittaa mahdottomiakin arvoja.

Nyt huomasin että AI oli asettanut minimiarvoksi 1. Eli kun N&S kirjoitti periodiksi 0, niin rekisteriin meni arvo 1. Ei vastaa emulaatio totuutta, eikä rekisteridumppi kerro totuutta sekään.

Toisaalta tämäkin selvisi kun ihmettelin miksi joku kirjoittaisi periodiksi 1. Pyysin AI:ta selvittämään missä kohtaa koodia se tapahtuu. Tutkinnan jälkeen AI löysi oman virheensä. Tosin koitti taas ehdottaa että mitä jos korjattaisiin minimiarvoksi 124, sitähän manuaalikin sanoo :x3:
 
OpenAI yleensä antaa agentin tehdä tehtävän valmiiksi, vaikka käyttöraja loppuisi sen aikana, nytkin pistin pyörimään, kun oli 1% 5 tunnista jäljellä. Ei näköjään syönyt viikkorajaakaan kuin prosentin, pakko olla bugi, tuskin haluavat lahjoittaa käyttöä noin
Tämä on ilmeisesti korjattu ja viikkoraja laskee, juhlat on siis ohi. Omalla käytölläni saan viikkokäyttöä jotain 80-90% vähemmän, pitää harkita kannattaako pitää koko subia.
 
Penninvenytysvinkki:
Modal.com tarjoaa $30 edestä ilmaista käyttöä kuukaudessa, nämä tarjolla:
1780310397504.png

Kokeilin H200 + gpt-oss-120b ja 128K kontekstilla sehän toimii todella näpsästi ja tottelevaisesti. Toki tuo konteksti-ikkuna ei oo "ihan" Clauden tasoa, mutta tuo Modal on ihan kätevä backup kuten aikaisemmin olenkin mainostanut
 
Kyber-Hampaattomaksi viilattu mythos tasoinen claude fable 5 julkaistu. Kukaan testannut, räjähtääkö pää kuinka hyvä/tyhmä? Linkinpäässä kilometrin verran tekstiä ja ja kuvia mitä voi tavailla. Poimin ketjun kannalta pari oleellista alle
Today we’re launching Claude Fable 5: a Mythos-class1 model that we’ve made safe for general use.
Fable 5’s capabilities exceed those of any model we’ve ever made generally available. It is state-of-the-art on nearly all tested benchmarks of AI capability, showing exceptional performance in software engineering, knowledge work, vision, scientific research, and many other areas. The longer and more complex the task, the larger Fable 5’s lead over our other models.
1781025329753.png

Taskien ja tokenien hinnoista
Fable 5 and Mythos 5 are being offered at $10 per million input tokens and $50 per million output tokens—less than half the price of Claude Mythos Preview
Fable 5 is also more token-efficient than past Claude models
1781025361571.png


Karut kävyt piilotettu ihan blogin loppuun. 22.6 jälkeen jos meinaa käytellä parasta mallia niin joutuu api-hinnoitteluun. Käy kalliiksi parhaan mallin käyttäminen pian kun ei edes 200e/kk tilauksella pääse malliin kiinni. Toki lupailevat, että jos joskus kapasiteetti konesaleissa riittää niin malli palaa perustilauksiin, mutta sitä aikaa saanee odotella kauan.

1781025823489.png

 
Viimeksi muokattu:
Päätin laittaa Fable 5:n kokeiluun, mutta kaikenlaista API-virhettä yms. tulee tällä hetkellä. Lienee melko paljon käyttäjiä juuri nyt.
 
Kyber-Hampaattomaksi viilattu mythos tasoinen claude fable 5 julkaistu. Kukaan testannut, räjähtääkö pää kuinka hyvä/tyhmä? Linkinpäässä kilometrin verran tekstiä ja ja kuvia mitä voi tavailla. Poimin ketjun kannalta pari oleellista alle

Karut kävyt piilotettu ihan blogin loppuun. 22.6 jälkeen jos meinaa käytellä parasta mallia niin joutuu api-hinnoitteluun. Käy kalliiksi parhaan mallin käyttäminen pian kun ei edes 200e/kk tilauksella pääse malliin kiinni. Toki lupailevat, että jos joskus kapasiteetti konesaleissa riittää niin malli palaa perustilauksiin, mutta sitä aikaa saanee odotella kauan.

1781025823489.png


Jahas, tästäkö se nyt sitten alkaa?

Opus 4.8 menee edelleen jatkuvasti idioottimoodiin, mutta mikäs se on ollut jauhaa samoja asioita moneen kertaan kun käyttörajaa on kuitenkin piisannut ja työnantaja maksaa. Vähän voi kyllä alkaa vituttamaan, jos taksa juoksee jokaisesta "jätin noudattamatta kaikkia juttuja joita eksplisiittisesti käskit noudattaa, sen sijaan väänsin tähän serverihuoneen lattialle ripulipaskat ja deletoin koko repon" perseilystä.

Mielenkiintoista nähdä miten kilpailijat reagoi.
 
Karut kävyt piilotettu ihan blogin loppuun. 22.6 jälkeen jos meinaa käytellä parasta mallia niin joutuu api-hinnoitteluun. Käy kalliiksi parhaan mallin käyttäminen pian kun ei edes 200e/kk tilauksella pääse malliin kiinni. Toki lupailevat, että jos joskus kapasiteetti konesaleissa riittää niin malli palaa perustilauksiin, mutta sitä aikaa saanee odotella kauan.
Maksukykyisistä ja -haluisista asiakkaista tuskin tulee puute. Tietysti täällä persaukissa Euroopassa jäädään entistä enemmän jälkeen.
 
Maksukykyisistä ja -haluisista asiakkaista tuskin tulee puute. Tietysti täällä persaukissa Euroopassa jäädään entistä enemmän jälkeen.
Itsekkäästä perspektiivistä kahtiajakoinen olo. Se aika ohi kun pystyi käyttämään parasta "huvin vuoksi, pikkurahalla", toisaalta hienoahan tuo on, että oletettavasti keinoälykoodaus ottaa isoja askeleita eteenpäin vaikka itse en tule todennäköisesti enää surffaamaan aallonharjalla. ' Toivottavasti saavat hinnannostoilla kysyntä/tarjonnan sellaiseen vaateriin, että idioottimoodi olisi historiaa(en pidättele hengitystä). Menee just tuohon mitä kirjoitit, ne pelaa joilla on sekä syy että varallisuus olemassa, muut etenevät mopoilla tai kävellen.
claude-fable-5-will-be-not-available-after-few-weeks-heres-v0-hdkguezuna6h1.jpg


Jotain random youtube videoita katsoin missä porukka saanut viikon etukäteen fable:n käyttöön. Kommentit pääasiassa erittäin positiivisia. Hyvää, tekee isoja ja pitkäkestoisia taskeja todella hyvin. Huonoa, hidas ja ei ole tarkoitettu interaktiiviseen käyttöön tai kysymys/vastaus tyyliseen promptaamiseen.
 
Viimeksi muokattu:
Toivottavasti saavat hinnannostoilla kysyntä/tarjonnan sellaiseen vaateriin, että idioottimoodi olisi historiaa(en pidättele hengitystä)
Voisin jopa harkita omalla rahalla ostavani kallista APIa aina välillä, jos tuo toteutuisi. Bisneksen kannalta tilanne on aika perverssi, heillähän ei kannata pyrkiä siitä eroon, ennemminkin laittaa välillä aina päälle tai hienostuneemmin ohjeistaa mallia, että lisäilee huomaamattomia bugeja ja päälle vielä joku rajumpi if(randomi<0.02)idioottimoodi() ja laskutusta tulee paljon enemmän, kun asiat ei mene kerralla maaliin..
 
Voisin jopa harkita omalla rahalla ostavani kallista APIa aina välillä, jos tuo toteutuisi. Bisneksen kannalta tilanne on aika perverssi, heillähän ei kannata pyrkiä siitä eroon, ennemminkin laittaa välillä aina päälle tai hienostuneemmin ohjeistaa mallia, että lisäilee huomaamattomia bugeja ja päälle vielä joku rajumpi if(randomi<0.02)idioottimoodi() ja laskutusta tulee paljon enemmän, kun asiat ei mene kerralla maaliin..
Taitaa tuo fable olla vain kovin kallis jos/kun pitää paikkansa, että on parhaimmillaan pitkäkestoisissa taskeissa. Jättää raksutteleen API hinnalla niin tonneja palaa helposti, hetkessä. Tuplahinta versus opus.
 
Taitaa tuo fable olla vain kovin kallis jos/kun pitää paikkansa, että on parhaimmillaan pitkäkestoisissa taskeissa. Jättää raksutteleen API hinnalla niin tonneja palaa helposti, hetkessä. Tuplahinta versus opus.
Jep, jää tuntien raksuttelut historiaan, hyvä jos uskaltaa jotain hyvin tarkasti rajattuja pikkujuttuja teettää.
 
Maksukykyisistä ja -haluisista asiakkaista tuskin tulee puute. Tietysti täällä persaukissa Euroopassa jäädään entistä enemmän jälkeen.
Riippuu hinnoittelusta. Jos devaaja saa poltettua kymppitonneja kuussa, niin ne tokenit pitää jossain vaiheessa kun toimareiden AI-huuma loppuu, pystyä perustelemaan, ihan kuten tähänkin asti on erilaisten työkalujen kanssa mennyt. Niitä satoja tonneja vuodessa tienaavia koodareita on loppujen lopuksi aika rajallinen määrä rajallisessa määrässä firmoja. Meille muille jos tokeneita menee enemmän kuin oma kustannus on työnantajalle, niin siinä useimmilla on kova homma perustella kulu.
 
A vetää taas näköjään hyvin, estot viritetty niin tiukalle, että somet täynnä valitusta, pari esimerkkiä:
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/mehulmpt/status/2064449391969374238

1781043611578.png


Joops. Ajattelin, että voisi tänään testailla Fablea tositoimissa, mutta näköjään nuo "safety measuret" on käännetty suoraan asentoon "insane".

Ilmeisestikin kaikki edes etäisesti biologiaan liittyvä menee automaattisesti sensuuriin täysin riippumatta asiayhteydestä. Itsehän teen tässä sellaisia ultravaarallisia, potentiaalisesti ekoterrorismiin, rahanpesuun ja kansainväliseen ihmiskauppaan liittyviä juttuja, että yritän mallintaa kuolleiden puiden juurten hajoamista maaperässä. Veri tankero.
 
Riippuu hinnoittelusta. Jos devaaja saa poltettua kymppitonneja kuussa, niin ne tokenit pitää jossain vaiheessa kun toimareiden AI-huuma loppuu, pystyä perustelemaan, ihan kuten tähänkin asti on erilaisten työkalujen kanssa mennyt. Niitä satoja tonneja vuodessa tienaavia koodareita on loppujen lopuksi aika rajallinen määrä rajallisessa määrässä firmoja. Meille muille jos tokeneita menee enemmän kuin oma kustannus on työnantajalle, niin siinä useimmilla on kova homma perustella kulu.
En ole alalla, mutta investointien ja vastaavien kanssa tullut pelattua vuosia.

Eihän tuossa muuta oleellista ole, kuin että kasvaneet kustannukset pitää saada laskutettua asiakkailta. Jos kehitystiimi käyttää vaikka 100000€/kk tokeneihin, asiakkaalta pitää saada laskutettua 100000+ kate enemmän /kk.

Tehostaako AI-työkalu niin paljon tekemistä, että lisäkustannuksen voi kirjoittaa laskuun katteen kera? Muustahan siinä ei ole kyse, jos asiakkaalle myydään. Toinen vaihtoehto on sitten se, että työntekijöitä voidaan vähentää yli 100000€/kk kulujen verran, eli vaikka 15 ukkoa/akkaa. Tuottavuus on tuottavuus ja se pitää muuttaa laskutettaviksi euroiksi. Ei sitä huvikseen puuhastella.

Sitten pidemmässä juoksussa AI tasoittaa peliä, koska kaikki käyttävät samoja työkaluja ja suoltavat samaa tuubaa eri logolla. Sitten aletaan kilpailemaan katteella, koska laatu on samaa ja kenelläkään ei ole etumatkaa muihin. Vähennetään työntekijöitä käytännössä, koska työkaluissa ei saa etumatkaa, jos kaikilla on samat kaupalliset työkalut käytettävissä ja ostettavissa.
 

Uusimmat viestit

Statistiikka

Viestiketjuista
310 370
Viestejä
5 263 861
Jäsenet
83 804
Uusin jäsen
vonhande

Hinta.fi

Back
Ylös Bottom