AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Deepseek pistää ulos nyt lopulliset versiot, aika hyvää parannusta aikasempaan ainakin Flash osalta.
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/deepseek_ai/status/2083084415157022911?s=46

DeepSWE tulosta katsoo finaali versus preview niin ei voi välttyä ajattelemasta, että on jotenkin optimoitu tai iso bugi ollut vanhassa versiossa/haarniskassa. Onko optimointi sitten silmänkääntötemppu vai oikeasti osaa paremmin niin paha sanoa mallia testaamatta. Lieköhän deepswe benchmarkkikin muuttunut merkityksettömäksi numeroksi joka ei kuvaa enää todellisuutta.
 
Viimeksi muokattu:
Mä aloin tarkastelemaan että mitä vaatis jos tommoista lokaalisti ajais, 256GB DDR5 niin varmasti onnistuis hyvällä tarkkuudella mutta näköjään muistin hinnat ja etenkin saatavuus on vielä katastrofaalisempi kuin uskoinkaan niin unohdetaan tässä vaiheessa :D
 
Mä aloin tarkastelemaan että mitä vaatis jos tommoista lokaalisti ajais, 256GB DDR5 niin varmasti onnistuis hyvällä tarkkuudella mutta näköjään muistin hinnat ja etenkin saatavuus on vielä katastrofaalisempi kuin uskoinkaan niin unohdetaan tässä vaiheessa :D
Laitoin Paikallisesti pyörivät LLM koodausavustimet lokaaliavustinketjuun kommentit (kai) parhaasta 128GB muistilla toimivasta mallista macbook pro m4 max:lla ajettuna. Malli laguna-s-2.1 117B, 8B aktiivista MoE:ssa, 47token/s. TLDR, vuoden pilveä perässä, toimii jos jaksaa iteroida ja käsin säädellä. Niin hidas aika time to first token, että iterointi vaatii lehmänhermot. Sinällään toimisi, jos jaksaa odotella, odotella ja iteroida+käsin korjata. Käytin poolsiden omaa haarniskaa testeissä kun se on tuolle mallille parhaiten optimoitu haarniska.

Jos meinaa lokaaleja isompia käytellä niin tarvii todella nopean kiihdyttimen jonka muistiin malli mahtuu. CPU:lle jaettu MoE kun gpu-muisti loppuu kesken on niin hidas että ei kannata edes harkita. Tuo laguna olis varmaan rtx 6000 pro:llakin vielä liian hidas, että minä sitä jaksaisin käyttää, mahtuisi tosin nvfp4 optimoituna versiona hyvin kortin 96GB muistiin ja jäisi tilaa kontekstille.

Laguna-s-2.1 näyttää aluksi nopealta. Kun koodia alkaa olemaan edes jonkinlainen määrä niin time to first token menee käsittämättömän hitaaksi. Ts. hyvä tekeen pohjan, todella huono kun pitäisi iteroida/muutella. Oli tämä kutenkin melko iso askel parempaan suuntaan versus aikaisemmat mallit mitä olen testannut. Tästä mallista pitäisi tulla myös parempia versioita tulevaisuudessa.
 
Viimeksi muokattu:
Niinno käyttäjiä ja käyttötarkoituksia on monia, ihan vain leikkikaluks meinasin, ehkä joskus sitten jotain kotiautomaatiota pyörittämään ja keksittyjä tarinoita kirjoitttamaan yms. olen nähnyt että vastaavilla seteillä CPU pyörityksellä + pienellä offloadauksella on nähty 15+ tok/sec lukuja mitkä vois olla tuollaiselle kokeilulle ihan ok.

Koodaukseen käytän mieluiten parasta API mallia mitä on tarjolla.

e. vertailitko yhtään onko tuo laguna huomattavasti parempi kuin qwen 3.6 27b koodijutuissa?
 
Niinno käyttäjiä ja käyttötarkoituksia on monia, ihan vain leikkikaluks meinasin, ehkä joskus sitten jotain kotiautomaatiota pyörittämään ja keksittyjä tarinoita kirjoitttamaan yms. olen nähnyt että vastaavilla seteillä CPU pyörityksellä + pienellä offloadauksella on nähty 15+ tok/sec lukuja mitkä vois olla tuollaiselle kokeilulle ihan ok.

Koodaukseen käytän mieluiten parasta API mallia mitä on tarjolla.
Oletin koodaushommia tän ketjun puitteissa.

Kirjoitushommaan laguna on todella hyvä. Sama juttu pikku skriptien yms. kanssa kun niissä time to first token ei tule ongelmaksi + ei ole ongelma iteroida pikkujuttuja/korjata jälkiä. Lagunan pienempääkin versiota kehuttu hyväksi kirjoittamaan.

Tähän malliin kyllä ostaisin ennemmin nvidian spark:in ja unohtaisin cpu:lle jakamisen. Malli on optimoitu nvfp4:lle. nvfp4 versiolla fp8 version tarkkuus ja pienempi koko. applella joutui ajamaan huonompana 4bit versiona niin ei ehkä laatu edes ole ihan sama kuin nvfp4:lla ja tarvii enemmän muistia. nvfp4 67GB siinä missä 4bit versio 96GB ja 8bit versio 128GB. Jos jotain uutta rautaa niin parempi olla nvfp4/mxfp4 tuki niin saa hyödyt nyt kun uudet mallit alkavat tuota formaattia tukemaan. Komea miten 117B malli menee 67GB kokoon ja tuolla saadaan fp8 tason tarkkuus ja fp4 nopeus.

1785495071375.png


NVFP4 tuollainen kaksitasoisista palasista koostuva kompressio millä saadaan lisää tarkkuutta. MXFP4 melkein vastaava, mutta isommat palaset ja ei tensoriskaalainta
1785495292525.png
 
Viimeksi muokattu:
Deepseek V4 Pro hermesin kanssa oli sellasta vääntämistä ja varomista että mitä se taas tekee, että sinne en ainakaan noita enää ota testiin. Deepeek API:ssa sisässä jotain kymppejä rahaa, niin jotain höpöä vois testailla että miten se sujuu. Mutta yleensä noihin malleihin on päässy paremmin sisälle sitten vasta kun enemmän käyttänyt, niin oppii sen tavat tehdä asioita.
 
Lieköhän olis bisnes tehdä konttikoodauskonesaleja. Ihan muutama tai ehkä vain yksikin helix/nvl72 räkki konttiin. Kontteja ripottelee firmojen/tekkiparkkien pihoille. Räkkiin sais melko hyvän määrään kimi k3:sta ajoon ja eikun bulkkitokenit kontista. Noita vaikea mihinkään normaaliin konesaliin/konttoriin laittaa kun pitäisi olla 100kW+ energiaa per räkki ja vaikea nestejäähy. Jossain kohtaa tulee 1MW räkit ja siinä kohtaa tuollainen kontti+räkki vois olla tosi kova "on prem, avoimet mallit" ratkaisu,...

Samasta teemasta niin eilen yritin katsoa millä hinnalla sais oikeista konesaleista pienen määrän nopeaa gpu:ta vuokralle. Iänvanha h200:en 141GB muistillakin hinnat lähtee 2$/h. Tosi kallista olis pelkkä rauta vuokrata pilvestä ja ajaa edes pientä avoimien painojen mallia pilvessä.

Alkaa noita hyviä hinta/laatu avoimien painojen malleja olemaan, mutta ongelmana löytää suorituskykyinen ja samalla järkevänhintainen ratkaisu "Ilmaisen" ajamiseen.
 
Heitin Codexissa GPT-lunalle Amiga ASM koodia tarkastettavaksi testausmielessä, että miten se pärjää MAX-tilassa sen kanssa, niin onkohan ensimmäisiä versioita nämä 5.6:set että aktiivisesti googlaavat kuten tässä.
1785499594445.png
 
Lieköhän olis bisnes tehdä konttikoodauskonesaleja. Ihan muutama tai ehkä vain yksikin helix/nvl72 räkki konttiin. Kontteja ripottelee firmojen/tekkiparkkien pihoille. Räkkiin sais melko hyvän määrään kimi k3:sta ajoon ja eikun bulkkitokenit kontista. Noita vaikea mihinkään normaaliin konesaliin/konttoriin laittaa kun pitäisi olla 100kW+ energiaa per räkki ja vaikea nestejäähy. Jossain kohtaa tulee 1MW räkit ja siinä kohtaa tuollainen kontti+räkki vois olla tosi kova "on prem, avoimet mallit" ratkaisu,...

Samasta teemasta niin eilen yritin katsoa millä hinnalla sais oikeista konesaleista pienen määrän nopeaa gpu:ta vuokralle. Iänvanha h200:en 141GB muistillakin hinnat lähtee 2$/h. Tosi kallista olis pelkkä rauta vuokrata pilvestä ja ajaa edes pientä avoimien painojen mallia pilvessä.

Alkaa noita hyviä hinta/laatu avoimien painojen malleja olemaan, mutta ongelmana löytää suorituskykyinen ja samalla järkevänhintainen ratkaisu "Ilmaisen" ajamiseen.
En usko, että koodaamisessa tulee ihan helposti pärjäämään, ainakaan suoraan. Mutta ei kaikki workloadit ole koodaamista ja eivät täten ole niin herkkiä suuremmalle latenssi budjetille ;)
 
En usko, että koodaamisessa tulee ihan helposti pärjäämään, ainakaan suoraan. Mutta ei kaikki workloadit ole koodaamista ja eivät täten ole niin herkkiä suuremmalle latenssi budjetille ;)
kyllähän se koodauksessakin latenssi vaikuttaa paljon siihen mitä saa tokeneita. Joku 20x ero kimi k3:lla riippuen miten asettaa toimimaan. Tähän päälle ultranopeat gpu+cerebras ratkaisut missä gpu tekee prefill:in ja cerebras tokeneiden luonnin. Nämä tosi kalliita mutta nopeita tokeneita.

Mietin konttia ratkaisuna sille, että saisi a) on prem missä joku ei päivänä X sano, että sinulle tarjoilu loppui juuri nyt b) sähkö+raudanhinnalla tokenit versus maksat vielä pilvipalvelun ylläpitäjän marginaalin. Tämä tuli mieleen kun eilen yritin katsoa mitä maksaa pelkkä h200 rauta vuokrata pilvestä,...
pareto-gb300.png

 
Heitin Codexissa GPT-lunalle Amiga ASM koodia tarkastettavaksi testausmielessä, että miten se pärjää MAX-tilassa sen kanssa, niin onkohan ensimmäisiä versioita nämä 5.6:set että aktiivisesti googlaavat kuten tässä.
1785499594445.png
Kyllä ainakin GPT 5.5 googlasi aktiivisesti.
 
kyllähän se koodauksessakin latenssi vaikuttaa paljon siihen mitä saa tokeneita. Joku 20x ero kimi k3:lla riippuen miten asettaa toimimaan. Tähän päälle ultranopeat gpu+cerebras ratkaisut missä gpu tekee prefill:in ja cerebras tokeneiden luonnin. Nämä tosi kalliita mutta nopeita tokeneita.

Mietin konttia ratkaisuna sille, että saisi a) on prem missä joku ei päivänä X sano, että sinulle tarjoilu loppui juuri nyt b) sähkö+raudanhinnalla tokenit versus maksat vielä pilvipalvelun ylläpitäjän marginaalin. Tämä tuli mieleen kun eilen yritin katsoa mitä maksaa pelkkä h200 rauta vuokrata pilvestä,...
pareto-gb300.png

Joo siis tarkoitin, että muilla käyttötarkoituksilla voi olla helpompi aloittaa. Monet asiat, mitä itse näkee, ei ole mitenkään latenssiherkkiä. Vaan järjestelmässä tapahtuu jotain, siitä lähtee käsittely putki päälle ja se ei haittaa, vaikka juoksee minuutteja. Koodaus on suht latenssiherkkää, saati sitten joku puhelinpalvelun automatisointi, niin nuo on raudan puolesta vähän hankalia, jos ei ole tosi syvät taskut. Ja harvalla on niin syvät.

Tuollaista tullut itsekin mietittyä, mutta ehkä enemmänkin sen control plane jne kannalta. Mietin itse tuota raudasta riippumatta. Periaatteessa voisi olla dgx sparkista AMD räkki palvelimeen ja voit deployaa malleja, softaa, agentteja, verkkoja jne. Pienemmällä vaan vähemmän ja hitaammin toimivaa.
 
Joo siis tarkoitin, että muilla käyttötarkoituksilla voi olla helpompi aloittaa. Monet asiat, mitä itse näkee, ei ole mitenkään latenssiherkkiä. Vaan järjestelmässä tapahtuu jotain, siitä lähtee käsittely putki päälle ja se ei haittaa, vaikka juoksee minuutteja. Koodaus on suht latenssiherkkää, saati sitten joku puhelinpalvelun automatisointi, niin nuo on raudan puolesta vähän hankalia, jos ei ole tosi syvät taskut. Ja harvalla on niin syvät.

Tuollaista tullut itsekin mietittyä, mutta ehkä enemmänkin sen control plane jne kannalta. Mietin itse tuota raudasta riippumatta. Periaatteessa voisi olla dgx sparkista AMD räkki palvelimeen ja voit deployaa malleja, softaa, agentteja, verkkoja jne. Pienemmällä vaan vähemmän ja hitaammin toimivaa.
Toki muitakin käyttötapauksia on, mutta tän ketjun aihe koodausavustimet niin en yrittänyt mitään yleistä bisnesmallia esittää. Tuli tämä mieleen kun ei noissa suht pienissäkään lokaaleissa malleissa kuten mun eilen testaama 117B laguna s2.1 riitä suorituskyky millään järkihintaisella raudalla. spark/macbook pro/amd halo strix hitaita,... rtx6000 pro 4x suorituskyky noihin verrattuna mutta maksaa 15ke + kone ympärille. Se mitä omista koodaustesteistä pystyn extrapoloimaan niin rtx6000 pro:kin olisi niin hidas, että ennemmin maksaisin pilvestä.

Mun koodaustarpeeseen ja odotusajoille mitä jaksaa odottaa niin olisi aikalailla ainoa vaihtoehto hommata konesalitason rautaa. Vuokrahinnat ihan järjettömiä. Rautaa omaksi ostaessa hinta skaalaa niin, että 72gpu räkki on per gpu reilusti halvempi kuin yksi gb300 gpu dellin gb300 serverissä ostettuna(100ke-150ke dell). Spark yms. niin hitaita ettei niistä ole mihinkään kun pienet mallit vaativat iteraatioita eivätkä one shottaa. Tuollainen 100kW+ räkki niin sitä ei pysty mihinkään normaaliin cpu-serverihuoneeseen asentamaan kun puuttuu tuki virransyötöstä ja jäähdytyksestä. Muutaman vuoden sisään oikeasti tulossa 1MW räkit,...

Jos nyt sen verran jatkaa tuosta kontista, että koodaus on siitä oiva käyttötapaus, että joku aika pienikin kooderimäärä pystyy räkin saturoimaan niin että räkki jauhaa täysillä 24/7 versus että olisi jotain chattibotteja ajossa toimistoaikana. Ongelma koodaushommissa tokenien hinta mikä rajoittaa paljonko ai:ta voidaan käyttää.

Kimi K3:en mikä lienee heittämällä paras avoimista painoista niin paras suorituskyky tällä hetkellä vaatii 16xgb300 konfigin. 8xgb300:lla toimii, mutta huomattavasti huonompi suorituskyky/$ versus 16gpu konffi Kimi K3 Is Here: Efficient Day-0 Support on vLLM

tldr versio, vaikka koodausputka olisi valmis ostamaan 3M-5Me nvl72 pömpelin niin sen asentaminen firman tiloihin todennäköisesti mahdotonta.
 
Viimeksi muokattu:
Toki muitakin käyttötapauksia on, mutta tän ketjun aihe koodausavustimet niin en yrittänyt mitään yleistä bisnesmallia esittää. Tuli tämä mieleen kun ei noissa suht pienissäkään lokaaleissa malleissa kuten mun eilen testaama 117B laguna s2.1 riitä suorituskyky millään järkihintaisella raudalla. spark/macbook pro/amd halo strix hitaita,... rtx6000 pro 4x suorituskyky noihin verrattuna mutta maksaa 15ke + kone ympärille. Se mitä omista koodaustesteistä pystyn extrapoloimaan niin rtx6000 pro:kin olisi niin hidas, että ennemmin maksaisin pilvestä.

Mun koodaustarpeeseen ja odotusajoille mitä jaksaa odottaa niin olisi aikalailla ainoa vaihtoehto hommata konesalitason rautaa. Vuokrahinnat ihan järjettömiä. Rautaa omaksi ostaessa hinta skaalaa niin, että 72gpu räkki on per gpu reilusti halvempi kuin yksi gb300 gpu dellin gb300 serverissä ostettuna(100ke-150ke dell). Spark yms. niin hitaita ettei niistä ole mihinkään kun pienet mallit vaativat iteraatioita eivätkä one shottaa. Tuollainen 100kW+ räkki niin sitä ei pysty mihinkään normaaliin cpu-serverihuoneeseen asentamaan kun puuttuu tuki virransyötöstä ja jäähdytyksestä. Muutaman vuoden sisään oikeasti tulossa 1MW räkit,...

Jos nyt sen verran jatkaa tuosta kontista, että koodaus on siitä oiva käyttötapaus, että joku aika pienikin kooderimäärä pystyy räkin saturoimaan niin että räkki jauhaa täysillä 24/7 versus että olisi jotain chattibotteja ajossa toimistoaikana. Ongelma koodaushommissa tokenien hinta mikä rajoittaa paljonko ai:ta voidaan käyttää.

Kimi K3:en mikä lienee heittämällä paras avoimista painoista niin paras suorituskyky tällä hetkellä vaatii 16xgb300 konfigin. 8xgb300:lla toimii, mutta huomattavasti huonompi suorituskyky/$ versus 16gpu konffi Kimi K3 Is Here: Efficient Day-0 Support on vLLM

tldr versio, vaikka koodausputka olisi valmis ostamaan 3M-5Me nvl72 pömpelin niin sen asentaminen firman tiloihin todennäköisesti mahdotonta.
Joku niche firma/ firman osasto jossa kehitetään militarypuolelle softaa tai vastaavaa voisi satatonnieuroluokassa kysellä IT-päälliköltä omaa komeroa johon gpu-kortteja pinoon räkkiin ja heidän omaan erilliseen fyysiseen verkkoon liitäntä?
 
Joku niche firma/ firman osasto jossa kehitetään militarypuolelle softaa tai vastaavaa voisi satatonnieuroluokassa kysellä IT-päälliköltä omaa komeroa johon gpu-kortteja pinoon räkkiin ja heidän omaan erilliseen fyysiseen verkkoon liitäntä?
Semmonen fiilis, että vaikka avoimet painot tyyliin kimi k3 muuttuisivat primääriseksi tavaksi käyttää AI:ta koodauksessa niin konesalienomistajat nauravat matkalla pankkiin. Ei ole oikein realistista keinoa ostaa kimi k3 kelpoista räkkiä normifirman tiloihin ja maksaa tokeneista "vain" raudan+sähkön hintaa. Kimi K3 vaatii helios/nvl72 räkkityylisen ratkaisun kun malli jaettu vähintään 8gpu kesken ja kommunikaation korttien välillä oltava nopea. Ei voi kasata pcie:n päälle kun pcie on liian hidas.

Räkin virrankulutus ja jäähdytysongelma. Ei ole tiloja suunniteltu tuollaisille 130kW-150kW räkeille. Vaatii myös järeän suljetun vedenkierron jäähyn. Yleensä firmojen serveritilat suunniteltu paljon vähemmän virtaa imeville ja lämpöä tuottaville cpu-räkeille. Tilat ajalta ennen kuin nykyisenkaltaiset ai-kiihdytinräkit "keksittiin".

Tuo ongelma vielä kertautuu kun on oikeasti tulossa muutaman vuoden sisään 1MW räkkejä.

Mutta ehkä tätä nyt ei tässä ketjussa kannata oikeasti jatkaa. Tuli vaan tämä ajatus vastaan kun yritin löytää vuokraratkaisua avoimien mallien ajamiseen koodaustarkoituksessa kun ei lokaaliraudalla pääse etiäpäin tavalla millä haluaisin. Vuokraaminen järjettömän kallista ja ostaminen erittäin haastava asennuksen ja operoinnin puolesta.
 
Viimeksi muokattu:
OpenAI:n seuraava malli julkinen salaisuus. Altman kävi viikolla siitä juttelemassa poliitikkojen kanssa, malli menee jonkinlaisen virallisen prosessin läpi ennen yleistä saatavuutta. Taitaa olla sama malli kun kyberhäkkeröi ja ratkoo matematiikkaa. Mielenkiintoista nähdä kuinka kallis ajaa, miten toimii koodauksessa ja onko syyskuussa tarjolla. Tulee jännä syksy kun anthropic joutunee vastaamaan uudella frontier mallilla ja ehkä google/microsoft/... tulevat mukaan kisaan edes gpt5.6 tason malleilla.

Menee nuo matematiikkajutut niin ohi omasta osaamisesta ettei pysty sanomaan kuin, että vaikuttaa hienolta. Onko sitten oikeita kunnon todistuksia ongelmille joita ihmiset ei osanneet aikaisemmin ratkoa niin ?!?
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/polynoamial/status/2083467194663571701?ref_url=

We provide new results for the following problems. The results were achieved by an internal version of Astra, our next major model. The total number of tokens needed to find solutions to these problems would cost roughly $2,000 at Sol API rates. These arguments were then prepared into manuscripts by humans with the same model. Afterward, the model formalized each argument in a Lean certificate⁠(opens in a new window). We are also releasing for each solution a model’s narration of its thinking process.

OpenAI:ta naurattaa, kun ne varmaan koodauttaa ja opettaa seuraavaa mallia astralla tässä kohtaa.
 
these problems would cost roughly $2,000 at Sol API rates
Olisihan kiva jos kertoisivat paljonko se Astralla maksoi...100 vai 8000$ :)

Näin aamuväsynä kääntyy päässä OpenAI Astra > Opel Astra .. toivottavasti nimi ei korreloidu laatuun :coffee:
 
OpenAI:n seuraava malli julkinen salaisuus. Altman kävi viikolla siitä juttelemassa poliitikkojen kanssa, malli menee jonkinlaisen virallisen prosessin läpi ennen yleistä saatavuutta. Taitaa olla sama malli kun kyberhäkkeröi ja ratkoo matematiikkaa. Mielenkiintoista nähdä kuinka kallis ajaa, miten toimii koodauksessa ja onko syyskuussa tarjolla. Tulee jännä syksy kun anthropic joutunee vastaamaan uudella frontier mallilla ja ehkä google/microsoft/... tulevat mukaan kisaan edes gpt5.6 tason malleilla.

Menee nuo matematiikkajutut niin ohi omasta osaamisesta ettei pysty sanomaan kuin, että vaikuttaa hienolta. Onko sitten oikeita kunnon todistuksia ongelmille joita ihmiset ei osanneet aikaisemmin ratkoa niin ?!?
Ainakin kun lueskelin X:stä kommentteja aiheesta, niin kyllä nuo ilmeisesti ihan kelpaavaa kamaa ovat. Monet uskovat, että tekoäly tulee muuttamaan matematiikkaa tieteenä radikaalisti, kun lähivuosina ratkotaan tekoälyn avulla useimmat pitkäaikaiset matemaattiset ongelmat.
 
Olisihan kiva jos kertoisivat paljonko se Astralla maksoi...100 vai 8000$ :)

Näin aamuväsynä kääntyy päässä OpenAI Astra > Opel Astra .. toivottavasti nimi ei korreloidu laatuun :coffee:
Ei se ainakaan astralla halvempi ole kuin sol:lla. Astran huhuttu olevan merkittävästi isompi malli. sol kai 4 biljoonaa parametria. Laitetaan astra max 10 biljoonaa parametria kokoon ja skaalataan MoEt samassa suhteessa isommaksi niin maksaa tuplat astra tokenit versus sol, jos ei ole muuta eroa kuin koko? Varmaan todellinen hinta riippuu paljon siitä miten tokenitehokas, miten paljon vaatii rinnakkaista reasoning ajoa jne. Tietty se kilpailutilannekin, kun hintaa ei voi asettaa tyhjiössä.

Fieldsin mitalin juuri saanut superkova kanadalainen matemaatikko jacob tsimerman menee openai:lle duuniin: https://www.wsj.com/tech/ai/openai-jacob-tsimerman-fields-medal-ai-safety-391d0f79
 
Ei se ainakaan astralla halvempi ole kuin sol:lla. Astran huhuttu olevan merkittävästi isompi malli. sol kai 4 biljoonaa parametria. Laitetaan astra max 10 biljoonaa parametria kokoon ja skaalataan MoEt samassa suhteessa isommaksi niin maksaa tuplat astra tokenit versus sol, jos ei ole muuta eroa kuin koko? Varmaan todellinen hinta riippuu paljon siitä miten tokenitehokas, miten paljon vaatii rinnakkaista reasoning ajoa jne. Tietty se kilpailutilannekin, kun hintaa ei voi asettaa tyhjiössä.

Fieldsin mitalin juuri saanut superkova kanadalainen matemaatikko jacob tsimerman menee openai:lle duuniin: https://www.wsj.com/tech/ai/openai-jacob-tsimerman-fields-medal-ai-safety-391d0f79
Niin ajattelin että uutisen perusteella Astra olisi kyseisessä tehtävässä halvempi koska reasoning..jne mutta sitten price/token kumminkin kalliimpi. ns kuten Sonnet 5 vs Opus 5 vertailu pitkässä taskiss
 
Niin ajattelin että uutisen perusteella Astra olisi kyseisessä tehtävässä halvempi koska reasoning..jne mutta sitten price/token kumminkin kalliimpi. ns kuten Sonnet 5 vs Opus 5 vertailu pitkässä taskiss
Ei taida sol ratkaista kyseisiä matemaattisia ongelmia. Nuo kymmenen sellaisia mitä tutkittu vuosikymmeniä ihmisten toimesta ja olivat ratkaisemattomia. Osa kokonaisia ratkaisuja, osa uusia rajoja joiden sisällä ratkaisun oltava.

Ts. Astra teki uusia löytöjä ja todistuksia matematiikan saralla. Kyvykkyys pompsahtaa uudelle tasolle astran myötä.
 
Alibaba julkaisi 2.4biljoonan parametrin Qwen3.8-Max mallin. Mallin painot julkaistaan ensi viikolla. Väittävät että joissain taskeissa(ei koodaus) parempi kuin fable. DeepSWE 1.1:ssa pisteet ei niin vakuuttavat, mutta benchmarkit ei aina kerro koko totuutta. Eletään mielenkiintoista aikaa, vielä kun sais kotio raudan joka kykenee 2-3 biljoonan parametrin mallin suorituskykyiseen ajoon tai edes pilvestä ko. raudan halvalla tuntihinnalla vuokralle.

1785778061106.png

Blogipostaus on pidempi ja tarkempi kuin nälkävuosi
 
Alibaba julkaisi 2.4biljoonan parametrin Qwen3.8-Max mallin. Mallin painot julkaistaan ensi viikolla. Väittävät että joissain taskeissa(ei koodaus) parempi kuin fable. DeepSWE 1.1:ssa pisteet ei niin vakuuttavat, mutta benchmarkit ei aina kerro koko totuutta. Eletään mielenkiintoista aikaa, vielä kun sais kotio raudan joka kykenee 2-3 biljoonan parametrin mallin suorituskykyiseen ajoon tai edes pilvestä ko. raudan halvalla tuntihinnalla vuokralle.

1785778061106.png

Blogipostaus on pidempi ja tarkempi kuin nälkävuosi
Tässä on ihan jännää matikkaa K3:n kohdalla vastaavasta asiasta.


Mutta ehkä tärkein on tässä
1785825586859.png


Edes tuo 30B tokenia isolla cache osumalla ei ole pienelle porukalle aivan mahdotonta. Itsellä huiput ollu siellä 4-5B välissä kuukaudessa, mutta yhden henkilön on aika hankala tuonne päästä. Toki tuo vaatii omaa osaamista porukassa, ja jos mietitään organisaatiota, niin se osaaminen maksaa aika hyvin. Mutta jos sulla on kymmeniä, jopa satoja devaajia, niin se kulu häviää kyllä aika hyvin. Ihan ok haarniskoja taitaa jo löytyä ihan avoimenakin.
 
Tässä on ihan jännää matikkaa K3:n kohdalla vastaavasta asiasta.

Tosi hyvin tehty artikkeli. Tuollaista kaivannutkin, että joku tavaisi auki ja yrittäisi eri vaihtoehdot. Artikkeli ei huomannut halvinta järkevää konffia mikä on 16*GB300. 12gpu:ta tokenien luontiin ja 4gpu:ta prefilliin. Tuolla saa 3x suorituskyvyn versus 8x gpu, skaalaa paremmin kuin lineaarisesti kiitos nopean nvlinkin ja prefill:in erottamisesta omaksi kuormaksi. Tuossa konfigissa myös jätetään riittävästi gpu muistia kv-cachelle että voidaan oikeasti palvella monia samanaikaisia pyyntöjä.

Eiköhän tota kimi k3:sta vielä optimoida. Vaikuttaa niin monimutkaiselta, että luulisi mahdollisuuksia olevan.

--

Tokeneita alkaa kyllä palamaan jos niitä saa käyttää "rajattomasti". ai-agentti jauhaa parannuksia tunnottomasti koodista testeihin ja katselmointiin + optimointeihin jos on budjettia. Samalla poistuu tech debt kun ei tarvi aina jatkaa vanhan päälle vaan voi tunnottomasti refaktoroida.

--

Kilpailu siirtyy malleista haarniskoihin + uudet frontier mallit 2-3kk sisään. Hypet tietty aina suolan kera. Veikkaan, että tuo "more than your laptop" viittaa pilvi vm:aan missä hommaa ajetaan 24/7/365. Jauhaminen jatkuu vaikka laittas läppärin kiinni + rinnakkaistuu paremmin.
1785840778656.png
 
Viimeksi muokattu:
rtikkeli ei huomannut halvinta järkevää konffia mikä on 16*GB300.

Eiköhän halvempi ja järkevämpi tapa ole kuitenkin MI355X. Toki sitä ei ole vielä optimoitu yhtä pitkälle, mutta MI355X taitaa olla puolet halvempi kuin GB300 samalla muistimäärällä. Vaatii toki hieman askartelua, jotkut artikkelit ovat kuitenkin tuplanneet suorituskyvyn suhteessa siihen mitä tulee ilman muutoksia. Hintaero on aika iso kuitenkin (vuokrattuna puolet ja samoin taitaa olla ostettunakin jos vaan toki kumpaakaan saa käsiinsä ostamalla). Olettaisin että Kimi K3 saa aika paljon vielä optimointia jokaisella platformilla.

Itse olisin toki varmaan tuollaisessa tilanteessa kiinnostuneempi DeepSeek V4 Flashista, se näyttää toimivan aika hyvin jo yhdellä MI300X:lläkin sujuvasti: GitHub - ryanzhou/deepseek-v4-flash-mi300x (830 tok/s aggregate maksimissaan).

Varsinkin kun tuo V4 Flash näyttäisi olevan aivan pätevä malli.
 
Eiköhän halvempi ja järkevämpi tapa ole kuitenkin MI355X. Toki sitä ei ole vielä optimoitu yhtä pitkälle, mutta MI355X taitaa olla puolet halvempi kuin GB300 samalla muistimäärällä. Vaatii toki hieman askartelua, jotkut artikkelit ovat kuitenkin tuplanneet suorituskyvyn suhteessa siihen mitä tulee ilman muutoksia. Hintaero on aika iso kuitenkin (vuokrattuna puolet ja samoin taitaa olla ostettunakin jos vaan toki kumpaakaan saa käsiinsä ostamalla). Olettaisin että Kimi K3 saa aika paljon vielä optimointia jokaisella platformilla.

Itse olisin toki varmaan tuollaisessa tilanteessa kiinnostuneempi DeepSeek V4 Flashista, se näyttää toimivan aika hyvin jo yhdellä MI300X:lläkin sujuvasti: GitHub - ryanzhou/deepseek-v4-flash-mi300x (830 tok/s aggregate maksimissaan).

Varsinkin kun tuo V4 Flash näyttäisi olevan aivan pätevä malli.
mi355x:ssa ei ole nvfp4 tukea mille tuo kimi k3:en on optimoitu. NVFP4:lla fp4 suorituskyky ja fp8 tarkkuus. AMD:lla mxfp4 tuki mikä on samankaltainen idea kuin nvfp4 mutta vain yksitasoinen kompressio, vähemmän skaalausbittejä ja isommat palaset(32vs. 16). ts. mxfp4:lla tarkkuus kärsii enemmän kuin nvfp4:lla.

Toinen puoli, että mi355x:ssa ei suorituskyky skaalaannu huonon kommunikaatioratkaisun vuoksi yli 8gpu kuormille. ts. prefill+token luonti jako on huono toteuttaa. Kimi K3 on todella raskas kommunikoimaan kun kuorma jaetaan usealle gpu:lle. Tämänkin ongelman ratkoo amd:lla vuoden lopussa helios+mi450. Vanha amd ei ole hyvä kun mennään yli 8gpu kuormaan.

En myöskään tiedä onko amd:lle tuota optimoitua prefill/token generation ratkaisua. Nähnyt vain nvidian osalta juttua tuosta kimi k3:en yhteydessä. Softaa tarvii + nopean kommunikaation piirien välille + 16gpu++ tuen. perustan väitteet: Kimi K3 Is Here: Efficient Day-0 Support on vLLM
 
Viimeksi muokattu:
mi355x:ssa ei ole nvfp4 tukea mille tuo kimi k3:en on optimoitu.
K3 julkaistiin kylläkin MXFP4 muodossa. NVFP4 formaatissa jos painot löytyy niin ne on kolmannen osapuolen tekemiä ja bloattaa kokoa snadisti parantamatta kuitenkaan tarkkuutta.

Mun ymmärtääkseni MI355X:llä voi ajaa MXFP4 ihan w4a4 kiihdytyksellä.
 
K3 julkaistiin kylläkin MXFP4 muodossa. NVFP4 formaatissa jos painot löytyy niin ne on kolmannen osapuolen tekemiä ja bloattaa kokoa snadisti parantamatta kuitenkaan tarkkuutta.

Mun ymmärtääkseni MI355X:llä voi ajaa MXFP4 ihan w4a4 kiihdytyksellä.
Juu, huomasin saman. Olin väärässä tuon suhteen. MXFP4 on kuitenkin huonompi kuin nvfp4. MXFP4:ssa kvantisoitavat palaset 32 numeroa versus nvfp4 16 numeroa. Helpompi löytää pienemmille palasille skaalainarvot. Toinen puoli, että nvfp4 kaksitasoinen skaalaus ja skaalainarvoissa enemmän bittejä. Ts. nvfp4:lla saat paremman tarkkuuden kuin mxfp4:lla.

Se suurin ongelma tuossa kuitenkin että amd ei skaalaa suorituskykyisesti yli 8gpu ratkaisuihin esim. 16 gpu ratkaisuun missä 12gpu:ta tokenin luonti ja 4gpu:ta prefill. Lähde: Kimi K3 Is Here: Efficient Day-0 Support on vLLM

Mutta turha tuosta on tässä ketjussa vääntää. Tuskin täällä on kenelläkään varaa vuokrata 8x tai 16x konesaligpu:ta kuukausiksi. Nopeasti tulee ikävä openai/anthropic api hinnoittelua/kuukausitilausta kun maksaa per tunti käytti rautaa tai ei.
 
Viimeksi muokattu:
MXFP4 on kuitenkin huonompi kuin nvfp4. MXFP4:ssa kvantisoitavat palaset 32 numeroa versus nvfp 16 numeroa.
Teoriassa varmaan noin, mutta eipä ole isot labrat toistaiseksi lähteneet Nvidian NVFP4 formaattia oikein suosimaan. Kiinalaiset on tehneet QAT käsittelyn alkuperäisille painoille MXFP4 ja Google Gemma 4:n tapauksessa Q4_0 formaatit mielessä.
 
Teoriassa varmaan noin, mutta eipä ole isot labrat toistaiseksi lähteneet Nvidian NVFP4 formaattia oikein suosimaan. Kiinalaiset on tehneet QAT käsittelyn alkuperäisille painoille MXFP4 ja Google Gemma 4:n tapauksessa Q4_0 formaatit mielessä.
Johtuu ihan vain siitä, että ottaa aikansa ottaa uudet formaatit haltuun. Ei tapahdu silleen, että lopussa vain kvantisoidaan vaan pitää koko mallin RL vaihe ja mieluusti myös pretraining vaihe tehdä nvfp4:lla. Mallin arkkitehtuuri pitää myös optimoida sopivasti. Hiljattain tähän tuli todella hyvä resepti millä RL vaihe saadaan nvfp4:lla 4x nopeammin läpi ja lopputulos käytännössä identtinen bf16:en kanssa. Saat 4x ulos konesalista nvfp4:lla.

1785843611123.png


 
Johtuu ihan vain siitä, että ottaa aikansa ottaa uudet formaatit haltuun. Ei tapahdu silleen, että lopussa vain kvantisoidaan vaan pitää koko mallin RL vaihe ja mieluusti myös pretraining vaihe tehdä nvfp4:lla. Mallin arkkitehtuuri pitää myös optimoida sopivasti.
Tää siis eroaa noista MXFP4 ja Q4_0 formaateista ettei voi vain tehdä QAT tai QAD treenausta mallille joka treenattu esim. BF16 tai FP8 formaatissa alunperin? Epäilen, mutta ehkä noin.
 
Tää siis eroaa noista MXFP4 ja Q4_0 formaateista ettei voi vain tehdä QAT tai QAD treenausta mallille joka treenattu esim. BF16 tai FP8 formaatissa alunperin? Epäilen, mutta ehkä noin.
Lue se linkattu 4bitter lesson artikkeli. Turha tästä on vängätä koodausavustinketjussa.
 
Nyt on kunnollinen benchmark, kaveri teki neljästä pelistä versiot neljällä eri avustimella ja arvioi lopputulosta.
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.
 
qwen-3.8-max deepswe:ssa. Tulos näyttää samalta kuin deepswe:n blogipostaus kertoi. Avoimet painot mallit vetävät helposti kölinali vuodentakaisen parhaimman suljetun frontier mallin. Kehitys on huiman nopeaa koodausavustimissa.
1785877065705.png
 
Opus5 on ollut benchmarkeissa hyvä mutta tuolla redditissä ollaan vähän eri mieltä. Moni käyttää opus 4.8 versiota pitäen sitä parempana.
Samaa oli mun mielestä opus 4.7, 4.8. Anthropic:lla on joku kikka missä todellisuus ja benchmark ei oikein kohtaa. Tai sitten vaan on dumb modea mitä tarjoillaan kun konesalikapasiteetti loppuu ja riippuu tuurista mitä saa.
 
Samaa oli mun mielestä opus 4.7, 4.8. Anthropic:lla on joku kikka missä todellisuus ja benchmark ei oikein kohtaa. Tai sitten vaan on dumb modea mitä tarjoillaan kun konesalikapasiteetti loppuu ja riippuu tuurista mitä saa.
Sama kokemus. Ihan päivän kunnon mukaan mitä konesali tarjoilee. Tietenkin lähtötilannekin aina eri kuten määrittelijänkin kunto, taski tietenkin vaihtuu koko ajan.

Onkohan missään mittailtu laadun vaihtelua? Eli samaa taskia kysellään ja LLM luonteesta johtuen aina tulee hieman eri vastaus yleisesti. Parhaimmillaan tulisi vain riittävän hyviä ratkaisuja tasaisella tahdilla. Tosin kiinnostaako tämäkään, eniten kiinnostaisi että kaikki vaihtuvat taskit maaliin hyvällä laadulla
 
Sama kokemus. Ihan päivän kunnon mukaan mitä konesali tarjoilee. Tietenkin lähtötilannekin aina eri kuten määrittelijänkin kunto, taski tietenkin vaihtuu koko ajan.

Onkohan missään mittailtu laadun vaihtelua? Eli samaa taskia kysellään ja LLM luonteesta johtuen aina tulee hieman eri vastaus yleisesti. Parhaimmillaan tulisi vain riittävän hyviä ratkaisuja tasaisella tahdilla. Tosin kiinnostaako tämäkään, eniten kiinnostaisi että kaikki vaihtuvat taskit maaliin hyvällä laadulla
Voisihan se olla ihan järkevää että joku DeepSWE päivittyisi kerran kuussa (ns malleille jotain optimointeja tehdään, jotka sitten vaikuttaa hyvin tai huonosti) että miten tulos voisi vaihdella.

Mutta onko Opus 5 huonompi kuin 4.8? Veikkaisin että ei, mutta kuten @finWeazel tuossa mainitsi niin olen sama mieltä joku Opus 5 ryntäys päällä > kapasiteetti loppu > mallia säädetään että rahalla saa älykyyttää, muuten dumb modea.

Menee varmaan x-viikkoa ja sitten se on taas "hyvä".
 
Huhuissa, että google olisi 1.5miljardin acqui hire diiliä tekemässä mechanize startupin Mechanize, Inc. kanssa. Tarkoitus parantaa googlen koodaustyökaluja: Google is in talks for a $1.5 billion-plus deal with AI coding agent startup Mechanize

Ei mechanize:sta paljoa ole tietoa. Jotain höpinää sivulla, että etsivät rajoja missä koodausavustimet hajoavat ja tekevät ratkaisuja korjauksiksi. Mielenkiintoinen rekryprosessi tuolla firmalla, täysin remote ja pitää AI:n avulla tehdä kotiprojekti 3h aikarajan sisällä + 1h puhelu perään. Näin se rekryäminenkin näemmä muuttuu ai:n myötä
1785953097714.png


Sekin mielenkiintoista miten törkeän paljon noi koodaus startupit on tehneet rahaa kun laskee kaikki yhteen. windsurf, cursor ai jne. Miljardit vaihtaneet omistajia melko vauhdilla.
 
Viimeksi muokattu:
Huhuissa, että google olisi 1.5miljardin acqui hire diiliä tekemässä mechanize startupin Mechanize, Inc. kanssa. Tarkoitus parantaa googlen koodaustyökaluja: Google is in talks for a $1.5 billion-plus deal with AI coding agent startup Mechanize

Ei mechanize:sta paljoa ole tietoa. Jotain höpinää sivulla, että etsivät rajoja missä koodausavustimet hajoavat ja tekevät ratkaisuja korjauksiksi. Mielenkiintoinen rekryprosessi tuolla firmalla, täysin remote ja pitää AI:n avulla tehdä kotiprojekti 3h aikarajan sisällä + 1h puhelu perään. Näin se rekryäminenkin näemmä muuttuu ai:n myötä
1785953097714.png


Sekin mielenkiintoista miten törkeän paljon noi koodaus startupit on tehneet rahaa kun laskee kaikki yhteen. windsurf, cursor ai jne. Miljardit vaihtaneet omistajia melko vauhdilla.
Oikeastaan mitä muutakaan työhaastattelussa kannattaa enää kysyä. Ennen oli plussaa jos oli koodannut Linuxin. Nyt kysytään miten koodaat Linuxin kolmessa tunnissa AI:lla + selitä mitä teit.
 
Oikeastaan mitä muutakaan työhaastattelussa kannattaa enää kysyä. Ennen oli plussaa jos oli koodannut Linuxin. Nyt kysytään miten koodaat Linuxin kolmessa tunnissa AI:lla + selitä mitä teit.
Tuossa oli jännää tuokin, että tehtävän jälkeen se 1h haastis mikä vedetään videolle. Yks haastattelee ja muut siellä työnantajafirmassa katsovat videon. Ei mitään 5 eri tyyppiä ja koko päivä haastattelumeininkiä. Aika virtaviivaistettu lähestymistapa.
 
Codeberg jatkossa ilmeisesti AI avustimille ei kiitos, mikähän "seuraavaksi paras" open source vaihtoehto? gitlab, gitea, forgejo?
Työelämässä oli muutamassa projektissa enterprise gitlab käytössä. Ei minulla mitään pahaa sanottavaa jäänyt vaikka ei samalla tavalla silloin taipunut isoihin monista PR:sta koostuviin muutoksiin kuin patch-pohjainen gerrit+jenkins. Tykkäsin kyllä gitlabin kaikki integroitu yhteen pakettiin + miten helppo oli laittaa omia koneita ajamaan ci-taskeja konttien sisällä. En tiedä miten ilmaisversio toimii ts. tuleeko jotain rajotteita mitkä ottaa päähän jos ei avaa lompakkoa.

--

Aika jännä tuo anti AI hapatus joissain piireissä. Vähän kuin hevosmiehet autoja vastaan tai kuuluisammat tuulimyllyt.
 
On liian halpa ollut ja lisää rahea haluavat
1786021750233.png
Jännä miten takamatkalla olevat myy halvalla. Sitten kun päästään kunnolla kisaan mukaan niin hinnat pompsahtaa. DeepSeek lienee päässyt jonkun pykälän ohi käyttäjämäärissä. META myy nyt halpaa, jos antaa käyttää omia datoja mallien opetukseen. Meta julkaisi eilen koodaustyökalun+uuden malliversion
Meta's New Mac Coding Agent Costs Up to 20x Less If You Let Meta Train on Your Data

With the Contributor tier enabled for ‌Meta‌ model training, Muse Spark 1.2 is priced at $0.10 for 1 million input tokens and $0.20 for 1 million output tokens. The Standard tier costs more and does not let ‌Meta‌ use prompts to train its models. Meta's New Mac Coding Agent Costs Up to 20x Less If You Let Meta Train on Your Data

Ottaisin astra huhun ison suolamäärän kera. Vaikka tulisi ensi viikolla niin voi olla suljettu preview eikä yleinen julkaisu
1786025908317.png
 

Statistiikka

Viestiketjuista
312 677
Viestejä
5 312 437
Jäsenet
84 316
Uusin jäsen
allupukki

Hinta.fi

Back
Ylös Bottom