AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Juu, muutamia tokeneita sieltä täältä, mutta suhteutettuna siihen, että vastaukset huononee, niin kannattaako? Itse nimenomaan epäilen, mutta jos joku haluaa testata, niin siitä vaan. Sillä AI:lla varmaan saa kirjoitettua sen obfuskaattorinkin.
Piti oikein chatgtp kysyä mielipidettä tähän:

Mitä Claude Code, Codex ja Cursor tekevät oikeasti?​


Ne eivät yleensä "pakkaa tokeneita" muuttujia nimeämällä.


Ne tekevät ennemmin:
  • lähettävät vain diffit
  • poistavat epäolennaiset tiedostot
  • tekevät tiivistelmiä vanhasta keskustelusta
  • hakevat vain tarvittavat symbolit
  • pilkkovat tehtävän useaan pienempään kutsuun

Näillä saadaan paljon suurempi säästö kuin muuttujien uudelleennimeämisellä.




Yhteenveto​


Keskustelun perusajatus on teknisesti oikeansuuntainen, mutta vaikutusta hieman liioitellaan.
  • ✅ Muuttujanimien lyhentäminen voi vähentää tokenimäärää.
  • ✅ Paikallinen muunnostaulu (symbolitaulu) on täysin mahdollinen toteuttaa.
  • ✅ Pienempi tokenimäärä tarkoittaa halvempaa ja nopeampaa ajoa.
  • ⚠️ Satunnaiset tai hashatut nimet heikentävät usein mallin kykyä ymmärtää koodia.
  • ⚠️ Suurin hyöty nykyisissä AI-koodausavustimissa tulee yleensä kontekstin valikoinnista ja tiivistämisestä, ei muuttujanimien pakkaamisesta
 
Piti oikein chatgtp kysyä mielipidettä tähän:
tän " Satunnaiset tai hashatut nimet heikentävät usein mallin kykyä ymmärtää koodia." saa helposti ratkaistua metadatalla mihin on kerätty ymmärrys siitä mitä muuttuja/funktio/parametri tekee/tarkoittaa. Jos suurennuslasilla ehdotin yhtä ajatusta miten voisi vähentää malleissa tokenien käyttöä, en väittänyt että mallit näin jo tekisivät. Oikeasti ei tiedetä mitä openai/anthropic servereillä tapahtuu, optimointeja pimitetään siinä toivossa että kilpailijat eivät tajua. Tosin kun moni käyttää jo nykyään jotain i,j,k tms. for loopeissa/indekseissä niin AI malli joka luottaa muuttujanimiin on kusessa versus jos toinen malli ymmärtää mitä ja miksi muuttujalla oikeasti tehdään.

MCP servereitä jotka "vähentävät tokenien käyttöä" agenttisessa koodauksessa on ihan järjetön määrä. Kaikenlaisia yrityksiä harrastelijat tehneet.

--

Anthropicista huhuttu, että vois rikkoa 2027 100miljardin liikevaihdon inferenssissä. Sanotaan 5% lisää tehoa ulos konesalista olis 5miljardia viivan alle. Jossain kohtaa pienetkin purot optimoidaan. Olis hauska tietää mitkä top10 softa optimointikohdetta on millä saadaan inferenssiin vauhtia lisää. Prosentit on miljardeja.
 
Viimeksi muokattu:
Samaan aikaan anthropic vuokraa todella kalliilla konesalikapasiteettia, 1.25miljardia spacex:lle konesalista/kk, 15Miljardia/vuosi, 220000gpu:ta. Ei ne huvin vuoksi/tappiolla lähde vuokraamaan: SpaceX Rents Out Colossus 1 Data Centre To Anthropic After AI Setbacks: Report
Edellisen sivun estimaatissa ei ollut tuota laskettu mukaan. Mikä tarkoittaa sitä että Anthropic kyntää tukevasti tappiolla tämän vuoden.

OpenAI tehnyt viisaasti optimoimalla tokenit.
 
Edellisen sivun estimaatissa ei ollut tuota laskettu mukaan. Mikä tarkoittaa sitä että Anthropic kyntää tukevasti tappiolla tämän vuoden.

OpenAI tehnyt viisaasti optimoimalla tokenit.
Eihän siinä olis mitään järkeä tehdä riprap sopparia spacex:n kanssa konesalivuokrasta ellei pystyisi myymään sen konesalin tuottamia tokeneita korkeammalla hinnalla kuin mitä vuokraus maksaa. Ei kukaan ole aseella uhkaamassa, että anthropic:in olisi tuo konesali vuokrattava. Onneksi IPO tapahtunee tän vuoden aikana niin nähdään miten terve/sairas anthropicin bisnes oikeasti on.
 
tän " Satunnaiset tai hashatut nimet heikentävät usein mallin kykyä ymmärtää koodia." saa helposti ratkaistua metadatalla mihin on kerätty ymmärrys siitä mitä muuttuja/funktio/parametri tekee/tarkoittaa.
Miten tämä sitten säästää niitä tokeneita kun nyt LLM ymmärtää niistä muuttujista saman. Lyhennät muuttujan nimeä, mutta lisäät sitten kuitenkin metadataa selittämään sen, mikä kadotettiin lyhennyksessä?
 
Miten tämä sitten säästää niitä tokeneita kun nyt LLM ymmärtää niistä muuttujista saman. Lyhennät muuttujan nimeä, mutta lisäät sitten kuitenkin metadataa selittämään sen, mikä kadotettiin lyhennyksessä?
Nopeasti ajateltuna varmasti hyöty tulee kun funktion allekirjoitusjälki pienenee. Jos koodissa kutsutaan 1300 kertaa funktiota

int tamaLaskeeYhteenKaksiKokonaislukua(int kokonaisluku 1, int kokonaisluku 2) {}

Tai

int sum(int n1, int n2) {}

Ja kontekstiin on ladattu valmiiksi yhden kerran tämän funktion selitys.
 
No tuotahan minä sanoin jo aikaa sitten - ja AI kanssa - että helvetin isoissa koodeissa voi päteäkin. Siellä saattaa olla satoja funktioita joita kutsutaan satoja kertoja. Mutta sitten alkaa joka tapauksessa olla aikamoinen konteksti, ja en tiedä mahdetaanko koko kontekstia sittenkään lähettää LLM:lle.
 
Mitä te käytätte viestimenä? Että codex voi ilmoittaa kun homman on tehnyt? Puhelimeen.
En ole jaksanut mitään viestintä kytkeä kiinni. Miettinyt kyllä, että vois joko asentaa linearin tai vibe-koodata projektinhallintasoftan. Ei käyttäisi koodaustyökalua speksailuun ja ohjailuun vaan jotain scrumm/kanban-tyylistä tikettihommaa. Samalla olisi helppo antaa ohjenuorat AI:lle, että katso projektin roadmappia että työnalla oleva fiitsöri tulee fiksusti tehtyä. Työkaluun puskisi myös käännöksen, testien, lintterin, screenshotit yms. tulokset. Pääsisi irti codex/claudecode ja saisi ehkä mukavamman tavan hanskata ja speksata projektia + kommentoida botin työtä. Slack olis mun valinta viestimeksi.

Uskon, että kun jatkan harrasteprojekteja syksyllä/talvella niin hands off koodista ja all in linear/projektinhallintasoftaan.
 
Minulla kännykän chatgpt paritettu mac minissä pyörivään codexiin.
Macos laittu ns. Server tilaan ja ei koskaan nuku ja herää aina jos sammunut ja ac:ta tarjolla.

Tuosta sit voi vähän sivussa millon mistäkin paimentaa sitä.
Ja tämä ihan harrasteprojekteihin.
 
On mullakin kännykässä se chatgtp. se ei vaan puske ilmoitusta kun codex saa hommat valmiiksi. Tuolta voi katella onko resettiä luvassa. spekulaatiotahan se on. mutta ite ainakin pistin nupit nyt kaakkkoon testiksi codetista. Will Codex Reset?
 
Torvalds ojentaa anti AI devaajia. Tämä kohta nauratti "Because it's not like natural intelligence is always all that great either." (tuijotan peiliä)
1784222972899.png


1784222869698.png


1784222927210.png

 
Kimi K3 tullut, kovia alustavia benchmarkkeja.
DeepSWE kertonee totuuden kunhan saavat.
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/angrytomtweets/status/2077809283350102317?s=46

Näyttää todella kovalta suoritukselta. Jos tuo deepswe tulos kääntyy suorituskyvyksi niin taitaa olla ensimmäinen avoimien painojen malli mikä on niin hyvä että en kiristelisi hampaita jos sellainen olisi lokaalisti ajossa ja pilvi käännetty pois päältä. Toki aika haastava saada mitään rautaa kotiin millä pystyy ajamaan 2.8biljoonaa parametrin mallia + iso konteksti. Ei taida edes voimavirta riittää sähköihin raudalle mikä ajaisi järkevällä nopeudella tuota mallia. Pitäs olla joku 8xgb300 tms(voin olla väärässä, vähän hattuvakiolla ilman parempaa tietämystä arvon tätä).
 
Mikäs tämä eurooppalainen uusi malli on, luin päivällä mutta nimi pääsi unohtumaan.
 
En tiedä kuinka totta Reddit - Please wait for verification mutta jos oikeasti toimii noin niin aika paljon on löysää codex:ssa koodauksen kannalta. Kuva kertoo enempi kuin tuhat sanaa. Open source ohjelmointikehys ai-agenteille joka pudottaa tokenienkäyttöä 80% ja parantaa lopputulosta. Vastaavia on tsiljoona. Jokaisen alkuperäinen tekijä kehuu kuinka hyviä. En ole yhtäkään noista kokeillut, ts. voi olla täyttä puppua

1784233507156.png

1784233668489.png

 
Viimeksi muokattu:
Yksi idea tuossa ilmeisesti on että työkaluja ei kutsuta yksi kerrallaan vaan tehdään niistä yksi paketti. Tuossa voi olla ongelmia tai sitten ei.

Mutta mielenkiintoisin on tämä. Eli on keksitty parempi tapa ohjata tekoälyä.
However impressive LLMs can be, an LLM is still, at its core, a statistical induction model over text-token probabilities.

For example, asking an LLM to choose among rock, paper, and scissors does not guarantee a uniform random result. If a true one-in-three distribution matters, the choice needs an external random-number source rather than an uncited assumption about model output probabilities.

In coding tasks, this is often fatal.

An agent is more likely to execute and generate code and logic that are statistically more common. But common code and common logic are often mediocre and under-considered.

Tura uses a different strategy.

During reasoning, a common agent reasons from the current state to the prompt goal. In that case, s1 is the current state, and sn is the goal given by the user prompt.
In programming tasks, this means that when an agent sees a goal like fixing a frontend bug, it is guided to reason through the full execution path, reconstruct the failure state, and identify the root cause before writing code. In the matched-High DeepSWE comparison, Tura Balanced passed 12 more of 60 binary task verifiers than Codex CLI High.
 
Open source ohjelmointikehys ai-agenteille joka pudottaa tokenienkäyttöä 80% ja parantaa lopputulosta. Vastaavia on tsiljoona. Jokaisen alkuperäinen tekijä kehuu kuinka hyviä. En ole yhtäkään noista kokeillut, ts. voi olla täyttä puppua
cavemania ja rtk ole itse käyttänyt. Ehkä hatusta sanoisin omassa käytössä tiputtaa 30% kulutusta, mutta mitään 60-80% en ole ikinä nähnyt.

cavemanista on minusta muutenkin ihan pätevä, ns jopa lukemisen kannalta kun tiivistää asian sisällön ns tyylin tämä meme:
1784267868961.png
 
Kävipä vähän hassusti tossa, ihan mielenkiinnosta halusin siirtyä tuosta vanhasta UNRAID nassista johonkin custom juttuun niin rakensin ubuntu serverin päälle mergerFS + SnapRaid setupin jota manageroi omatekoinen softa.

Käyntin fable 5 ja 5.6 Sol Max ainakin parin viikon edestä tokeneita sen rakentamiseen ja kovettamiseen, olen tehnyt vaikka mitä hardware testejä nytten, repinyt pooleissa olevia levyjä livenä irti ja työntänyt takaisin ja kattonut että datat pysyy kunnossa, testattu 1 levyn korruptoituminen, 2 levyn hajoaminen ja automaattinen restore, kaikenlaisia erikois edge caseja missä 1 levy on just korjattu 2-levyn parity poolissa ja koneen virtajohto vedetään ulos kun 2 datalevyn samanaikainen korjaus-sessio on kesken ja siitä on bootin jälkeen selvitty ja pooli automaattisesti korjautuu kasaan ja smb sharet palautuu itsestään. Vaikka mitä ssd cache driven hajoamisia simuloitu sekä huonolaatuisen sata-kaapelin tai usb-hdd telakan yhteysongelmia kesken tiedonsiirron tai recoveryn on testattu onnistuneesti oikealla raudalla, pitää pikku hiljaa alkaa olla tyytyväinen tulokseen.

MUTTA mutta mutta...

Tein niin että aina toimintojen lisäyksen jälkeen esim jos Sol Max teki toiminnon niin Fable 5 teki aina oman analyysin, testit ja raportit samasta toiminnosta ja vice versa, koska noita resettejä on ollut niin paljon niin useamman viikon tokenit meni audit-fix-audit-fix-audit tyyliin.

Sitten lopussa huomasin että kun SnapRaidin scrub jota ajellaan monessa tilanteessa automaattisesti korjaaman bitrot aikataulujen tai koneen sammutuksen yhteydessä tietty määrä että pysyy pariteetti aina kunnossa, huomasin että vaikka se on testattu että ongelmat sillä löydetään niin niitä ei ikinä automaattisesti korjata EIKÄ koko softassa ole edes nappia millä ne voi korjata :D

Fable, Sol ja Opus vetänyt syväanalyysia koko softasta ja tehnyt audittia koko softasta kerta toisensa jälkeen eikä yksikään maailman parhaista malleista löytänyt tai huomioinut että kaikkein yksinkertaisin ja simppelein ja tärkein toiminto ei saa yhtäkään callia missään tilanteessa :D

Nooh ompahan nyt korjattu mutta aika mielenkiintoista.
 
Viimeksi muokattu:
Ite oon huomannut että ailta ei kyllä ajatukset lopu ikinä jonkin jutun fixauksen suhteen. Lopulta on pakko vaan sanoa stop the bike ja time out. Ja sitten löytyykin joku ratkaisu kun alkaa pitemmältä suunnalta asiaa miettimään.
 
Ite oon huomannut että ailta ei kyllä ajatukset lopu ikinä jonkin jutun fixauksen suhteen. Lopulta on pakko vaan sanoa stop the bike ja time out. Ja sitten löytyykin joku ratkaisu kun alkaa pitemmältä suunnalta asiaa miettimään.
Näinhän se menee, pyrkivät enempi miellyttämään käyttäjää kuin kertomaan karuja totuuksia. Mulla auttanut tähän kun asettaa selkeet tavoitteet, kriteerit ja mittaukset. AI pystyy sanomaan, että tavoitteet täytetty. Jos on epäselvä tai rönsyilevä asia niin sitä voi aina vaan jatkaa ja jatkaa ja jatkaa. Vähän kuin autistinen ihminen joka haluaa viilata samaa, samaa, samaa.
 
Juu yleensä teen niin että eka laitetaan softa jotenkin toimimaan, millä tahansa keinoilla brute force prototyyppi toimintaan ja sitten kun se toimii niin lähetään parantamaan sitä.

Nyt ekaa kertaa laitoin kunnon specsit mitä odotetaan ja vaikka mitä listoja kuinka varma ja luotettava tuotoksen pitää olla, sanoin varmaan että pitää olla varmempi kuin kuuhun laskeutuminen ja jeesus että oli kyllä väärä lähtökohta :D Jossain vaiheessa tuntui että ollaan jossain super tehottomassa byrokraattisessa lafkassa, koko firma on täynnä managereita eikä kukaan tee oikeasti töitä, kaikki agentit kirjoitti koko päivän vain testejä ja dokumentaatiota ja tuntui että kukaan ei saa aikaan yhtään mitään, päivän päätteeksi se ainoa työntekijä kirjoitti jonkun yhden read-only toiminnon eikä homma edennyt yhtään mihinkään vaikka yritin tilannetta pelastaa :D

Oli pakko rm -rf koko projekti ja alottaa alusta eri spekseillä niin meni homma hyvin pakettiin.
 
Olen miettinyt, että millainen softa se pitäisi olla AI-agenttivetoisen softaprojektin hallintaan. Ei ratkaisu ole UML eikä jira tai linear. Nämä kaikki ovat liian nicheen keskittyviä.

Mietin tällä hetkellä, että pitäisi olla UML tyylinen arkkitehtuuri+käyttötapaukset sulautettuna. Mieluusti päätason kanvaasi missä palikoita ja palikoiden sisällä tekstinä määrittelyä. Tästä sitten generoituisi backlog mistä itemeitä sprinttiin. AI voisi suorittaa sprinttejä. Esim. kun käskee AI:n eka sprintissä dokumentoida ja suunnitella arkkitehtuurin niin kaikki näkyisi suoraan kanvaasissa visuaalisesti ja voi porata sisään katsomaan mitä vaikka server-x on syönyt ja vaihtaa teknologiaa tai antaa palautetta. Iteroidaan visuaalisen työkalun kautta.

Määrittelyt pitäisi olla aika korkean tason tekstinä eikä mitään metodi X, metodi Y. Sellaista että kun taviskin lukee läpi niin tajuaa mitä palikat tekevät ja mitä käyttäjä haluavat tehdä.

Vois huumorilla talvella vibe-koodauttaa omaa projektinhallintatyökalua. Ei sen takia, että sillä tekisi rahaa vaan ihan mielenkiinnosta, että löytyykö joku oikeasti hyvä tapa hallita AI-agenttien koodaamaa projektia.

Varmaan jos ei ole jo niin pian tulee joku template/wizard koodaustyökaluihin millä saa perusprojekteihin pohjat kasaan ilman että itse määrittelee. Hyvät oletusasetukset esim. webbisivun tekemiseen.
 
Viimeksi muokattu:
Fable, Sol ja Opus vetänyt syväanalyysia koko softasta ja tehnyt audittia koko softasta kerta toisensa jälkeen eikä yksikään maailman parhaista malleista löytänyt tai huomioinut että kaikkein yksinkertaisin ja simppelein ja tärkein toiminto ei saa yhtäkään callia missään tilanteessa :D
Harrastan itsekin tätä, että laitan mallit tarkastamaan ja vertailemaan toistensa tuotoksia. Kannattaa ottaa review-rotaatioon vielä DeepSeek V4 Pro mukaan. Se löytää usein sellaisia bugeja, jotka ovat jääneet huomaamatta OpenAI:n ja Anthropicin malleilta. Toki tulee vääriä positiivisiakin. DeepSeek on sen verran halpa, että siitä ei mene konkurssiin vaikka maksaisi API-requesteista käytön mukaan.
 
Olen miettinyt, että millainen softa se pitäisi olla AI-agenttivetoisen softaprojektin hallintaan. Ei ratkaisu ole UML eikä jira tai linear. Nämä kaikki ovat liian nicheen keskittyviä.

Mietin tällä hetkellä, että pitäisi olla UML+arkkitehtuuri sulautettuna yhteen niin, että voi määritellä järjestelmän arkkitehtuurin, käyttötapaukset jne. Mieluusti ehkä yks kanvaasi missä palikoita ja palikoiden sisällä tekstinä määrittelyä. Tästä sitten generoituisi backlog mistä itemeitä sprinttiin. AI voisi suorittaa sprinttejä. Esim. kun käskee AI:n eka sprintissä dokumentoida ja suunnitella arkkitehtuurin niin kaikki näkyisi suoraan kanvaasissa visuaalisesti ja voi porata sisään katsomaan mitä vaikka server-x on syönyt ja vaihtaa teknologiaa tai antaa palautetta. Iteroidaan visuaalisen työkalun kautta.

Määrittelyt pitäisi olla aika korkean tason tekstinä eikä mitään metodi X, metodi Y. Sellaista että kun taviskin lukee läpi niin tajuaa mitä palikat tekevät tai mitä käyttäjä haluavat tehdä.

Vois huumorilla talvella vibe-koodauttaa omaa projektinhallintatyökalua. Ei sen takia, että sillä tekisi rahaa vaan ihan mielenkiinnosta, että löytyykö joku oikeasti hyvä tapa hallita AI-agenttien koodaamaa projektia.

Varmaan jos ei ole jo niin pian tulee joku template/wizard koodaustyökaluihin millä saa perusprojekteihin pohjat kasaan ilman että itse määrittelee. Hyvät oletusasetukset esim. webbisivun tekemiseen.
Mikset anna AI:n hoitaa sitä? Projektinhallinta on kiittämättömin ja vittumaisin duuni ikinä, et kai sä sitä halua tehdä koko ajan?
Heittäydy asiakkaan rooliin ja anna AI:n hoitaa loput.
 
Mikset anna AI:n hoitaa sitä? Projektinhallinta on kiittämättömin ja vittumaisin duuni ikinä, et kai sä sitä halua tehdä koko ajan?
Heittäydy asiakkaan rooliin ja anna AI:n hoitaa loput.
Lues uusiksi mitä postasin. Kelailen ajatusta työkalusta millä minä tai joku muu voisi tehdä kätevämmin projekteja kuin joku jira+promptaaminen. Yksi tuollainen työkalu on 8090 — AI-Native Software Development Platform

Mä tapailen asioita huvin vuoksi. En usko koskaan tekeväni mitään koodaus/softatyötä enää rahan takia. Oon aikaisella omalla eläkkeellä, fat FIRE. Tän takia voin tehdä asioita mitkä kiinnostavat, en niitä mitä esimies käskee. Tällä hetkellä yksi aihe mikä kiinnostaa on mikä on paras tapa tehdä (omia) softaprojekteja ai-agenttien avulla. Se tuli jo viime talvena/keväänä selväksi ettei näissä mun jutuissa tarvi ihmisen kirjoittaa riviäkään koodia. Koodia joutunut kyllä tuijottelemaan sen varalta, että spottaa jotain parannettavaa.

Mun kaavailema työkalu ratkaisisi toivottavasti promptaamisen tarvetta vähemmäksi kun voi visuaalisesti pitää projektia kasassa ja tiketit+ promptit generoituvat työkalusta. MCP-serverin taakse koko paska,... Toki tikettejä vois työkalussa viilata ihminen ennen kuin laittaa tilaan mistä AI poimii työtä.

Ennen kuin eskaloituu tokenizer väännöksi niin tuo oli VAIN raaka idea, ei mikään totuus. Ei kannata alkaa mihinkään ei toimi, ei kannata vääntöön. Ota ennemmin brain storming ideana. Jos on pakko vääntää niin ennemmin kertoo mikä on parempi työkalu/tapa kuin kertoa miksi ei toimi. Jonkin aikaa mietin että linear+mcp-serveri olis ratkaisu, mutta se on vain tikettityökalu, ei softan suunnittelutyökalu. Mieluusti sulauttaisi käyttötapaukset+arkkitehtuurin+tiketit yhteen softaan.

Tuohon työkalun tueksi vielä: GitHub - CodeGraphContext/CodeGraphContext: An MCP server plus a CLI tool that indexes local code into a graph database to provide context to AI assistants. niin sais projektin toteutuksen parsittua graafiin. Pystyy AI sitten mcp-servereiden läpi katsomaan että toteutus ja suunnitelma synkissä. Jos ei niin nostelee tikettejä esiin missä jutellaan asiat läpi
 
Viimeksi muokattu:
Olen miettinyt, että millainen softa se pitäisi olla AI-agenttivetoisen softaprojektin hallintaan. Ei ratkaisu ole UML eikä jira tai linear. Nämä kaikki ovat liian nicheen keskittyviä.

Mietin tällä hetkellä, että pitäisi olla UML tyylinen arkkitehtuuri+käyttötapaukset sulautettuna. Mieluusti päätason kanvaasi missä palikoita ja palikoiden sisällä tekstinä määrittelyä. Tästä sitten generoituisi backlog mistä itemeitä sprinttiin. AI voisi suorittaa sprinttejä. Esim. kun käskee AI:n eka sprintissä dokumentoida ja suunnitella arkkitehtuurin niin kaikki näkyisi suoraan kanvaasissa visuaalisesti ja voi porata sisään katsomaan mitä vaikka server-x on syönyt ja vaihtaa teknologiaa tai antaa palautetta. Iteroidaan visuaalisen työkalun kautta.

Määrittelyt pitäisi olla aika korkean tason tekstinä eikä mitään metodi X, metodi Y. Sellaista että kun taviskin lukee läpi niin tajuaa mitä palikat tekevät ja mitä käyttäjä haluavat tehdä.

Vois huumorilla talvella vibe-koodauttaa omaa projektinhallintatyökalua. Ei sen takia, että sillä tekisi rahaa vaan ihan mielenkiinnosta, että löytyykö joku oikeasti hyvä tapa hallita AI-agenttien koodaamaa projektia.

Varmaan jos ei ole jo niin pian tulee joku template/wizard koodaustyökaluihin millä saa perusprojekteihin pohjat kasaan ilman että itse määrittelee. Hyvät oletusasetukset esim. webbisivun tekemiseen.
Taannoin suunnittelin pientä projektityökalua, joka toimisi wizard-tyyppisesti. Ideana että kuvailisin sille halutun projektin, minkä jälkeen kielimalli rakentaa arkkitehtuurin ja jakaisi kokonaisuuden osiin. Tämän jälkeen kävisin rakennetta läpi esimerkiksi kansio- tai komponenttinäkymässä, missä voi korjailla ja ohjeistaa tarkemmin.

Ideana käyttää tätä agenttia rajallisella paikallisella kielimallilla ja ohjelma pilkkoisi suuremman projektin pieniksi, rajatuiksi tehtäviksi ja antaisi mallille kerrallaan vain halutun tehtävän kannalta olennaisen kontekstin.

Projekti jäi kesken, mutta jossain vaiheessa vielä sen toteutan.
  • projektikuvauksen wizard
  • käyttötapausten generointi
  • komponenttipuu
  • jokaiselle komponentille selkokielinen vastuu ja rajapinnat
  • tehtävän generointi yhdelle komponentille
  • rajattu tiedostokonteksti paikalliselle mallille
  • muutosten diff
  • testikomennon suoritus
  • hyväksy/hylkää-toiminto
 
Oho Kimi K3
Kova on. Tosin paljon huhuja, että kallis ajaa ja perustuu distillaation sen sijaan että olisi alusta lähtien moonshotin itse tekemä.

Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/GavinSBaker/status/2078110934740980193
 
Jos tuo K3 perustuu isolta määrin distillaatioon niin se vasta olisikin aikamoinen suoritus kun näyttää olevan parempi kuin mallit mihin heillä olisi ollut pääsy sitä tehdessään. Eikä sillä tietty käyttäjälle ole mitään väliä miten se on tehty, kaikki ai mallit on kuitenkin isolta osin tehty varastetusta datasta lähtökotaisesti jo, turha edes miettiä asiaa.
 
Miten niin hohhoijaa? Jos jollain muulla perusteella olisi varastettu samanlainen määrä toisten ihmisten työtä niin sitähän ei vaan hyväksyttäisi. Nyt se onkin ihan ok?
 
Tuota grok 4.5 käyttäny hieman. Siitä kätevä että se tulee cursorin mukana kun pitää aika monesti vielä manuaalisesti ohjelmoida ja autocomplete on näistä imo paras. En oikein ole huomannut eroa esim gpt 5.6. Molemmissa on hyviä ja huonoja "hetkiä"
 
Jos tuo K3 perustuu isolta määrin distillaatioon niin se vasta olisikin aikamoinen suoritus kun näyttää olevan parempi kuin mallit mihin heillä olisi ollut pääsy sitä tehdessään. Eikä sillä tietty käyttäjälle ole mitään väliä miten se on tehty, kaikki ai mallit on kuitenkin isolta osin tehty varastetusta datasta lähtökotaisesti jo, turha edes miettiä asiaa.
Huhuissa, että pohja distilloitu ja päälle reinforcment learning:lla parannuksia.

Benchmarkeissa on se huono puoli, että jos sinulla on benchmarkin käyttämät datat voit sujauttaa ne malliin sisään RL:lla. Tästä seuraa, että malli näyttää hyvältä benchmarkissa, mutta ei toimi oikeasti. Tällaisia benchmarkeissa toimivia malleja on paljon, mutta pyörät tippuu alta oikeassa käytöstä. Moni benchmark on menettänyt merkituksensa(swe bench, swe bench pro jne.) kun tulokset eivät heijastele toimivuutta benchmarkin ulkopuolella. DeepSWE liene edelleen hyvä benchmark.

En usko, että kimi 3:en suorituskyky on huijausta. Mutta RL on silti ratkaisu siihen miten saat distilloidusta paremman.

Distillaatio, benchmark datojen sisäänsyöttö yms. lienee syitä miksi moni malli julkaisee vain painot eikä datoja+reseptejä miten on opetettu. Olisi noloa mallin tekijälle varmistaa että distillaatiohan se, ja oho, tossa on huijaukset benchmarkkeihin.
 
Viimeksi muokattu:
Benchmarkeissa on se huono puoli, että jos sinulla on benchmarkin käyttämät datat voit sujauttaa ne malliin sisään RL:lla. Tästä seuraa, että malli näyttää hyvältä benchmarkissa, mutta ei toimi oikeasti. Tällaisia benchmarkeissa toimivia malleja on paljon, mutta pyörät tippuu alta, samasta syystä moni benchmark on menettänyt merkituksensa(swe bench, swe bench pro jne.). DeepSWE liene edelleen hyvä benchmark.
Hyvin K3 näyttää pärjäävän näissä melko uusissa Artificial Analysisin agenttista kykyä osaamista mittaavissa testeissä. Long horizon testejä ja benchmarkkien datasetti on suljettu, joten sillä ei ole mallia voinut treenata.

Screenshot 2026-07-18 at 12-46-20 Kimi K3 - Intelligence Performance & Price Analysis.png
Screenshot 2026-07-18 at 12-46-05 Kimi K3 - Intelligence Performance & Price Analysis.png
Screenshot 2026-07-18 at 12-45-45 Kimi K3 - Intelligence Performance & Price Analysis.png

Jostain syystä benchmaxxaamisesta huudellaan vähemmän kun amerikkalaiset labrat julkaisevat mallejaan.

Distillaatio, benchmark datojen sisäänsyöttö yms. lienee syitä miksi moni malli julkaisee vain painot eikä datoja+reseptejä miten on opetettu. Olisi noloa mallin tekijälle varmistaa että distillaatiohan se, ja oho, tossa on huijaukset benchmarkkeihin.
Juu ja OpenAIn ja Anthropicin mallit ovat vielä suljetumpia... liekö tähän muuta rationaalista syytä keksittävissä kuin että benchmaxxaavat ja distilloivat vielä kovemmin... :kahvi:
 
Viimeksi muokattu:
Jostain syystä benchmaxxaamisesta huudellaan vähemmän kun amerikkalaiset labrat julkaisevat mallejaan.
Koodausketjun puitteissa huudeltu paljonkin. Kuten kirjoitin en usko, että kimi 3:en huijaa deepswe:ssa. Uskon, että toimii oikeasti. deepswe on ollut toimiva indikaatio reaalimaailman suorituskyvystä toisin kuin moni muu benchmark. Sitä odotellessa, että deepswe tulokset lakkaavat heijastelemasta todellisuutta ja tarvitaan taas uusi benchmark uusilla salaisilla datoilla.

Syynsä siihen kuitenkin on, että tietyt tahot eivät julkaise opetusdataa ja reseptejä ja julkaisevat vain painot,... Ei tarvi edes foliota tän asian pohtimiseen.

--

Mielenkiintoista tässä on, että nyt on avoimien painojen malli millä voisi koodauksessa korvata ison osan pilvitokeneista lokaalilla raudalla. Lähtölaukaus sille, että firmat voisivat ajaa on prem mallia isolle osalle koodaustokeneista. Toki rauta millä saadaan 3 biljoonan parametrin malli ajoon on mahdottomia toimisto-olosuhteisiin tällä hetkellä. Mutta ehkä vuoden päästä sama suorituskyky pienemmässä mallissa tai ehkä tulee kimi 3 tms. optimoitu rauta brute force nvidian sijaan.

Jos maksaisi esim. 100ke-200ke rauta millä saisi gpt5.6 xhigh tasoisen mallin ajoon lokaalisti ja rauta toimisi perus 220V töpselistä niin kuka ostaisi? Veikkaan että todella moni firma,... Tästä aukeaisi startupeille kuten tenstorrent valtavan hyvä ja iso markkina näyttää että heidän kiihdytin parempi/halvempi kuin nvidia ja avata todella iso markkina.
 
Viimeksi muokattu:
Koodausketjun puitteissa huudeltu paljonkin. Kuten kirjoitin en usko, että kimi 3:en huijaa deepswe:ssa. Uskon, että toimii oikeasti. deepswe on ollut toimiva indikaatio reaalimaailman suorituskyvystä toisin kuin moni muu benchmark. Sitä odotellessa, että deepswe tulokset lakkaavat heijastelemasta todellisuutta ja tarvitaan taas uusi benchmark uusilla salaisilla datoilla.

Syynsä siihen kuitenkin on, että tietyt tahot eivät julkaise opetusdataa ja reseptejä ja julkaisevat vain painot,... Ei tarvi edes foliota tän asian pohtimiseen.

--

Mielenkiintoista tässä on, että nyt on avoimien painojen malli millä voisi koodauksessa korvata ison osan pilvitokeneista lokaalilla raudalla. Lähtölaukaus sille, että firmat voisivat ajaa on prem mallia isolle osalle koodaustokeneista. Toki rauta millä saadaan 3 biljoonan parametrin malli ajoon on mahdottomia toimisto-olosuhteisiin tällä hetkellä. Mutta ehkä vuoden päästä sama suorituskyky pienemmässä mallissa tai ehkä tulee kimi 3 tms. optimoitu rauta brute force nvidian sijaan.

Jos maksaisi esim. 100ke-200ke rauta millä saisi gpt5.6 xhigh tasoisen mallin ajoon lokaalisti ja rauta toimisi perus 220V töpselistä niin kuka ostaisi? Veikkaan että todella moni firma,... Tästä aukeaisi startupeille kuten tenstorrent valtavan hyvä ja iso markkina näyttää että heidän kiihdytin parempi/halvempi kuin nvidia ja avata todella iso markkina.
Minä olen ymmärtänyt että raudan käytön puolesta datakeskukset on halvempia kuin lokaali varsinkaan kun llm hommat ei ole latenssi sensitiivisiä ja ruuhkaa voi jakaa maailman laajuisesti toisin kuin vaikka joku GeForce now ihan vain esimerkkinä
 
Minä olen ymmärtänyt että raudan käytön puolesta datakeskukset on halvempia kuin lokaali varsinkaan kun llm hommat ei ole latenssi sensitiivisiä ja ruuhkaa voi jakaa maailman laajuisesti toisin kuin vaikka joku GeForce now ihan vain esimerkkinä
Olet oikeassa ja sen takia vuoksi puhuin lähtölaukauksesta en tän päivän todellisuudesta. Tästä avautuu mahdollisuus esim. tenstorrent tai huawei tehdä disruptiivinen rauta joka on optimoitu yhdelle mallille. Yhdelle mallille optimoitu rauta on ainakin teoriassa parempi kuin geneerinen kiihdytin.

--

Tällä hetkellä ei ole edes lokaalirautaa olemassa millä voisi ajaa tuollaista 3 biljoonan parametrin mallia. Kaikki isoon malliin pystyvät raudat massiivisia räkkejä tyyliin nvl72 100kW+ ja vaativat konesalitason virransyötön ja jäähdytyksen.

Konesalirauta mahdollistaa optimointeja jotka tekevät myös mallin ajamisesta halvempaa versus yksittäinen lokaali kiihdytin. Suorituskyky optimoituu kun esim. jaetaan prefill ja token generation eri kiihdyttimille: 1.3: The Two Phases Defined — Prefill and Decode

Jos olisi mahdollista tehdä yksi laatikko 220V töpselistä missä olisi fiksu kiihdytin jossa kuorma jaetaan prefill ja token generation niin olisi mahdollista päästä omalla halvempaan versus konesali. Tällaista rautaa ei ole olemassa tänään joka toimisi 3 biljoonan parametrin mallille. Naivisti laskien tuollainen 3Biljoonan malli vaatisi jotain 8*GB300 raudan ja jos jaetaan kuorma prefill+token generation eri kiihdyttimille niin vielä enemmän. Tuollainen rauta olis 10kW-20kW ja hinta todennäköisesti 7-numeroinen.
 
Viimeksi muokattu:
In programming tasks, this means that when an agent sees a goal like fixing a frontend bug, it is guided to reason through the full execution path, reconstruct the failure state, and identify the root cause before writing code. In the matched-High DeepSWE comparison, Tura Balanced passed 12 more of 60 binary task verifiers than Codex CLI High.
Amiga-emulaattoria tehdessä on huomannut, että AI:lla on selvästi vaikeuksia hahmottaa kokonaisuuksia. Se että emulaatio on "cycle-exact" on vain pieni osa kokonaisuutta. Amigassa kaikki pyörii DMA:n ympärillä eli miten muistislotteja jaetaan apupiireille ja mitkä CPU:lle. 68k CPU myös tuhlaa muistislotteja, koska siinä on prefetch mutta loopeissa se on kuin huonosti tehty branch predictor. AI ei aina ymmärrä että ne täytyy toteuttaa tarkasti, koska CPU:n muistislotit vaikuttavat myös custom chippien toimintaan. Näiden takia on välillä pitänyt seurata AI:n tekemisiä ja laittaa steeriä "hei odotas, mieti vähän tota. eikö tuossa pitäisi ennemmin tehdä asia x ja y". AI sitten tietysti "olet oikeassa, teenpä sen nyt näin kun ehdotit".
 
Vaikka on paljon hehkutettu tuota K3 niin hyvin vähän olen nähnyt kommentteja millaista sitä on oikeasti käyttää, jos otan kimi code tilauksen ja isken kimi cli tulille niin tuleeko sieltä vähintään opus 4.8 koodia ulos, tekisi kyllä mieli kokeilla.
 
Ei hitto, mulla on tuo chatgpt pro ja käyttelin iloisesti Codexia, kunnes tuli että tokenit loppuu ja uudet tokenit käyttöön 23.7.
No sitte projekti oli niin hyvällä mallilla, että ostin 20$ lisätokenit ja aattelin että nehän riittää mukavasti tuohon resettiin.

No lopputulos oli, että päivässä loppuivat ne sitten. :D Siirryin nyt sitten Cursoriin jatkamaan töitä, katsellaan miten näissä nämä resetit ja tokenien hinnat kehittyy...
 
Ei hitto, mulla on tuo chatgpt pro ja käyttelin iloisesti Codexia, kunnes tuli että tokenit loppuu ja uudet tokenit käyttöön 23.7.
No sitte projekti oli niin hyvällä mallilla, että ostin 20$ lisätokenit ja aattelin että nehän riittää mukavasti tuohon resettiin.

No lopputulos oli, että päivässä loppuivat ne sitten. :D Siirryin nyt sitten Cursoriin jatkamaan töitä, katsellaan miten näissä nämä resetit ja tokenien hinnat kehittyy...
Noissa tilauksissa on usein aika paljon hönkää halvimmassa että saavat sut sisään niin ottaa vaan kaikilta firmoilta sen halvimman tilauksen ja vuorottelee niitä niin tuntuu että on loputtomasti tokeneita. :D
 
Ei hitto, mulla on tuo chatgpt pro ja käyttelin iloisesti Codexia, kunnes tuli että tokenit loppuu ja uudet tokenit käyttöön 23.7.
No sitte projekti oli niin hyvällä mallilla, että ostin 20$ lisätokenit ja aattelin että nehän riittää mukavasti tuohon resettiin.

No lopputulos oli, että päivässä loppuivat ne sitten. :D Siirryin nyt sitten Cursoriin jatkamaan töitä, katsellaan miten näissä nämä resetit ja tokenien hinnat kehittyy...
Lisätokenien ostaminen kuollut tie. 200e/kk tilauksessa on suhteettoman paljon tokeneita versus api-hinnalla.
 
Eilen pistin oman bankatun resetin sisään ja olivatkin yöllä resetoineet kaikki. Tossa 20 chatgtpssä siis.
 

Statistiikka

Viestiketjuista
312 964
Viestejä
5 311 481
Jäsenet
84 391
Uusin jäsen
akseli224

Hinta.fi

Back
Ylös Bottom