AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Paremminkin sitä laadukasta opetusmateriaalia on niukemmin, koska lähdekoodi oli arvokasta. GPU on siitä "helppo" että sillä haetaan tehokkuutta ja nopeutta.
Niukemmin toki, mutta puuttuu myös se roska, kun jokainen viikon koodannut ei julkaise näyttistä koskevaa tavaraa. Tähän olisi hauska kyllä saada/löytää joku testi tämän oman mututuntuman sijaan.
 
Niukemmin toki, mutta puuttuu myös se roska, kun jokainen viikon koodannut ei julkaise näyttistä koskevaa tavaraa. Tähän olisi hauska kyllä saada/löytää joku testi tämän oman mututuntuman sijaan.
Heitän vielä takavasemmalta semmosen extran, että cudan kanssa nvidian työntekijöillä epäreilu etu kun kontekstiin voidaan tuoda firman sisäisistä dokkareista oikeat käskyt ja kellojaksot, sisäiset koodit, ja jopa piirin hw:n toteutus mitkä auttavat optimoinnissa.
 
Aika iso osa nvidian omista cuda-koodeista on open sourcessa: NVIDIA Corporation tuohon päälle ohjelmointi ja arkkitehtuurioppaat ja gtc puheet.
NVidia Performance Primitives puuttuu.

Muuta open sourcea on myös missä cudaa käytetty. Ei open source hirveästi nvidiaa hidasta, kun koodit on enivei cuda eli nvidian rautaspesifisesti implementoitu. Ei pysty 1:1 tai helposti kääntään jollekin toiselle frameworkille kun toteutukset ja optimoinnit hyvin rautariipuvaisia.
Algoritmi on tärkeämpi kuin rautatason optimointi. Esimerkiksi jos tehdä oman FFT toteutuksen GPU:lle, niin suurin ongelma on löytää oikea algoritmi. Netistä sitä ei suoraan löydy ja "nopeiksi" väitetyt toteutuksista ovat hitaampia kuin NVidian cuFFT. Sama oli myös JPEG enkooderin kohdalla. NVidian toteutus on selvästi eri tavalla tehty kuin AI:n tekemä, minkä näkee profiloimalla ja JPEG-kuvan rakenteesta.

Uskon tosin, että suurimmalle osalle ihmisiä on vaikea muistaa ja pitää päässä kerralla kaikkia sääntöjä ja poikkeuksia mitä tarvii, että voi koodata nopeaa cuda-koodia, etenkin rinnakkaistuvaa sellaista. AI:lle ei ongelma muistaa sääntöjä ja pilkkoa algoritmia, prefetchiä yms. raudan vaatimaan formaattiin. Ja tietenkin se, että jos/kun profiloija on agenttiloopissa niin AI jaksaa tunteja ja tunteja jauhaa ja korjailla pullonkauloja, brute forcellakin on arvonsa kunhan yrityksistä kerätään opit talteen että seuraavalla kerralla pääsee halvemmalla.
Nämä. Mulla AI jauhoi FFT-optimointia öisin tuntikaupalla profiloiden ja testaten erilaisia toteutuksia.


Heitän vielä takavasemmalta semmosen extran, että cudan kanssa nvidian työntekijöillä epäreilu etu kun kontekstiin voidaan tuoda firman sisäisistä dokkareista oikeat käskyt ja kellojaksot, sisäiset koodit, ja jopa piirin hw:n toteutus mitkä auttavat optimoinnissa.
Ei niillä ole merkitystä, koska on myös profilointityökalut.
 
Ei niillä ole merkitystä, koska on myös profilointityökalut.
TLDR: Pointti oli, että kielimallit eivät ole sen armoilla mitä ovat nähneet opetusdatassa. Hyvät kielimallit yleistyvät sen verran, että lisätietoa kontekstiin tuomalla kyvykkyys kasvaa. Ei kannata liikaa ajatella vain opetusdatan kautta. Yritin tuoda esimerkkejä extra datasta jolla kyvykkyyttä saadaan parannettua kontekstiin lisätietoa tuomalla.

--

Jos et tiedä miten rauta oikeasti toimii niin kokeiltava alue on valtava. Jos tiedät miten lohkot oikeasti toimivat, juttelevat keskenään jne. niin pääsee nopeammin ytimeen. Paljon tehdään suoraan ptx assya isommissa pajoissa ja otetaan irti sekin mitä ei cuda suoraan paljasta. Paljon myös reverse engineerataan, että miten rauta oikeasti toimii että voisi löytää rautaan sopivimman eli nopeimman mahdollisimman algoritmin ja miten algoritmi mahdollisesti palastellaan eri suoritusyksiköiden kesken ja rinnakkaistetaan monta versiota ajoon yhtä aikaa.

Pitäisi myös saada kaikki tuhannet pienet ytimet jauhamaan tehokkaasti ilman "busy workkiä" ja muisti/cache pullonkauloja. Esim. sen jpeg:in kanssa, että montako jpeg:ia saat purettua per sekunti, ei se että saat yhden jpeg:in purettua nopeasti. Nvidian toteutus tehty se edellä, että yksi gpu toimii serverinä klusterissa kun opetetaan kielimallia kuvilla. Ts. pitäisi pystyä purkamaan mahdollisimman iso määrä kuvia per sekunti joka ei välttämättä ole sama asia kuin kuinka yksi kuva puretaan nopeimmalla mahdollisella tavalla.

Silleen vaikka, että tämä dokkari on ylimalkainen: 1. NVIDIA Blackwell Tuning Guide — Blackwell Tuning Guide 13.3 documentation ja https://docs.nvidia.com/cuda/cuda-c-programming-guide/ toki nvidialta löytyy julkisesti myös parempaa pdf:aa ja gtc-puheet. Veikkaan kuitenkin, että sisäisesti noihin löytyy vielä kasa lisää matskua millä pääsee suorempaan maaliin kuin "sokeasti" kokeilemalla. Vaikka se nvidian oma ptx kääntäjän sorsakoodi ja dokumentaatio vois olla hauska nähdä
 
Viimeksi muokattu:
TLDR: Pointti oli, että kielimallit eivät ole sen armoilla mitä ovat nähneet opetusdatassa. Hyvät kielimallit yleistyvät sen verran, että lisätietoa kontekstiin tuomalla kyvykkyys kasvaa. Ei kannata liikaa ajatella vain opetusdatan kautta. Yritin tuoda esimerkkejä extra datasta jolla kyvykkyyttä saadaan parannettua kontekstiin lisätietoa tuomalla.
Tämä pitää paikkansa. Oikeastaan olisi pitänyt tuoda esille se, että jos luo oman ohjelmointikielen niin AI osaa koodata sillä kun antaa sille säännöt. Ei ole sama asia kuin että olisi opetusdatassa, mutta osaa soveltaa tietoa. Ja voi osata hyvinkin.
Sitten ne asiat mitä cudasta ei kerrota, AI ei myöskään tiedä ulkomuistista.
 
Minä työssäni hieman erilaisen Java frameworkin kanssa painin, niin GPT-5.5 ei ollut minkäänlaista ongelmaa ymmärtää frameworkin tapoja, kun tein sille referenssihakemiston ja ohjeistin sen pitämään sitä totuuden lähteenä.

Tuolla tempulla syntyi 100% toimivaa koodia ihan tuosta vaan.
 
Torstaina päästään testaamaan
Aikaisemmin oli "jes" fiilis päästä testaa, mutta tänä päivänä?
- Mikä promptin hinta suhteessa taskiin (eg Sonnet 5 on kalliimpi mitä Fable jos vaikea taski jne)..
- Mitä rajoituksia on lisätty Magan toimesta? .. "Does my client-server authentication have vulnerabilities?" -> boom "you have been banned to OpenAI for 30 days"
- Nopeus
- Miten malli toimii torstaina ja miten se toimii 1kk päästä...kapasiteetti loppuu niin dummy mode iskee...jne

Ei tarvitse linkkailla 5.6 internal/beta testejä, lopullinen tuote kiinnostaa. Toivotaan parasta :)
 
Uskon, että mallien nopeus muuttuu keskivertokäytössä irrelevantiksi kun työkalut ja mallit paranevat sen verran että ihmisen ei tarvi puuttua tekemiseen kuin kerran päivässä tai harvemmin. Määrittelee taskit hyvin ja kone rouskuttaa kuten ihminenkin. AI dailyssa käy taskit läpi ja kovaa ajoa. Reaaliajassa jossain työkalussa interaktiot kun kone puskenut testatut PR:t tai puskenut patchin + kysymyksiä että miten jatkeaan. Homma kovin erilainen tässä kohtaa versus pitää vartin välein ohjeistaa tai kytätä reaaliajassa tulostetta, että onko joku menossa pieleen jos ei puutu. Muuttuu yhä tärkeämmäksi speksata asiat oikein, että säästäisi omaa vaivaa ja kone voisi tehdä pidempään itsekseen.

Toinen puoli on ne jotka maksavat nopeudesta. OpenAI:n kohdalla cerebras raudalla premium nopeuden tokenit ja myöhemmin vuodesta nvidialta premium nopeus vera-rubin + groq lpu kombolla.

Mulle kelpaisi tässä skenaariossa halvempi extra slow. Voin harrasteprojekteissa ihan hyvin odotella huomiseen jos se tarkoittaa että saan halvemmalla versus valmis kahdessa tunnissa. Extra slow:ssa erittäin isot batch-koot ja ajetaan myös piikkiajan ulkopuolella täytellen kuplia konesalin käyttöasteessa.
 
Viimeksi muokattu:
Nyt lomalla ja 100 euron pro plan on täysin riittämätön. Viikon toke it menee kahdessa päivässä ja olen käyttänyt kolme neljästä resetistä että pääsee jatkamaan. Enkä ole tosiaan koneella istunut. Codexin remote hoitaa.
 
En tiedä paljonko kuvan puhuvalle päälle voi antaa arvoa. Ei sen videoita ainakaan jaksa katsoa. Laukoo gpt5.6:sta kovia väitteitä, ilmeisesti ollut siinä ryhmässä jotka saivat previewin käyttöön
1783517788625.png


edit. Hieman openai news googlettelua niin paljon tulee gpt5.6, gpt5.6 ultra twiittejä vastaan. Voipi olla markkinointikampanjakin, mutta positiivista on viestit ja fronttijuttujen väitetään olevan nyt paremmin. Huomennahan tuo selviää sitten. Ehkä viikon sisään deepswe benchmarkki.
 
Viimeksi muokattu:
SpaceX:lta grok4.5. Numeroiden pohjalta lähenee kilpailukykyistä, mutta ei tätä taida juuri kukaan käyttää? Kovia väitteitä,... Kunhan saavat cursor ai yhteistyön hedelmät pöytään niin voi tulla hyväkin kilpailija grok:sta koodauspuolelle.
Grok 4.5 is priced at $2 per million input tokens and $6 per million output tokens. The model also achieves roughly 2x the token efficiency of comparable leading models, solving tasks in under half the number of steps. Overall, Grok 4.5 delivers the highest intelligence per unit of time and cost.
EU availability is expected in mid-July
1783541425849.png

1783541595893.png
 
Asiasta kukkaruukkuun. Olen tuohon Amigs-emulaattoriin luoda synteettiset levyaseman äänet. GPT on siihen ainakin kehno. Efektit muistuttavat enemmän C64:n piippauksia. Onko mitään ehdotuksia?
 
Tässä kun nykyään USA menee rajoittamaan jo nyt Fable ja kuulemma rajoitettu jo myös GPT-5.6, niin tähänkö jää länsimallien kehitys, kun miten ne tuosta voi tehostua kun nyt jo rajoitetaan.
 
SpaceX:lta grok4.5. Numeroiden pohjalta lähenee kilpailukykyistä, mutta ei tätä taida juuri kukaan käyttää? Kovia väitteitä,... Kunhan saavat cursor ai yhteistyön hedelmät pöytään niin voi tulla hyväkin kilpailija grok:sta koodauspuolelle.


1783541425849.png

1783541595893.png
Yritin tätä tänään x.ai API avaimella kokeilla ja tuli error : not available at your region.
 
Tässä kun nykyään USA menee rajoittamaan jo nyt Fable ja kuulemma rajoitettu jo myös GPT-5.6, niin tähänkö jää länsimallien kehitys, kun miten ne tuosta voi tehostua kun nyt jo rajoitetaan.
Sellainenkin pointti että jos Fable oli ”liian hyvä” niin myös GPT markkinointiosastolla on paineita ilmoittaa että myös meidän parasta mallia joudutaan rajoittamaan kun SEKIN on niin hyvä.
 
Tässä kun nykyään USA menee rajoittamaan jo nyt Fable ja kuulemma rajoitettu jo myös GPT-5.6, niin tähänkö jää länsimallien kehitys, kun miten ne tuosta voi tehostua kun nyt jo rajoitetaan.
Mielenkiintoinen skenaario olisi protektionismi. Rajaisivat käytön vain US. Kuinka paljon etumatkaa saisivat heidän ohjelmistojättiensä kautta. Tulisiko tuottavuuden parantumisen kanssa enemmän rahaa kansakunnalle kuin mitä AI firmat voivat Euroopalta ja muulta maailmalta laskuttaa. Menee jo politiikkaan vaikka aihetta sivuaakin
 
Mielenkiintoinen skenaario olisi protektionismi. Rajaisivat käytön vain US. Kuinka paljon etumatkaa saisivat heidän ohjelmistojättiensä kautta. Tulisiko tuottavuuden parantumisen kanssa enemmän rahaa kansakunnalle kuin mitä AI firmat voivat Euroopalta ja muulta maailmalta laskuttaa. Menee jo politiikkaan vaikka aihetta sivuaakin
Tähän on menty jo monitasoisella rakenteella
  • mallivalmistajat saavat mallit ensimmäisenä käyttöön, mahdollisesti ilman/pienemmillä turvaraiteilla ja paremmilla parametreilla(enemmän ajatustyötä).
    • Mythos alkuvuodesta jo käytössä anthropicin sisällä
    • Tokenit omakustannehintaan versus asiakkaat maksavat tokeneista enemmän kuin niiden luominen maksaa
    • Paremmat parametrit, malli ajattelee enemmän ja pidempään, ei "dumb modea"
  • Preview vaihe, kasa valittuja isoja firmoja saa previewin uudesta mallista. Mythos preview valituille firmoille maaliskuussa. Enemmän turvaraiteita. Näillä firmoilla mythos pysyi käytössä koko ajan, ei rajoituksia. Tällä listalla lienee myös eurooppalaisia firmoja, en jaksa tarkistaa.
  • Mythos julkinen, 6kk myöhemmin kuin anthropic sisäisesti, 3kk myöhemmin kuin suljettu preview. Isot turvaraiteet, "dumb mode" jne.
--

Mulle jäi kuva, että anthropic:ia haluttiin pakottaa yhteistyökykyisemmäksi. Löytyi hyvä keppi millä sitten anthropic:ia lyötiin. Anthropic vs. usa kinaaminen hyvin julkinen ja ilmeinen asia

Se mitä ehkä oikeasti politiikan ulkopuolelta pelätään ja dario amodein lausunnot eivät helpota asiaa niin kyberhyökkäysten rakentaminen uusien mallien avulla. Yritetään malleja myöhästyttää, että mallin löytämät reiät korjataan. Yleisen julkaisun jälkeen promptien tallennus serverille 30pv ajaksi, vahva tunnistautuminen, jos teet pahuuksia niin ehkä sinut saadaan kiinni.

Niin tai näin niin euroopan kannattaisi satsata omiin konesaleihin ja omiin frontier malleihin. Nykymaailmassa kannattaa olla omavarainen asioiden suhteen.
 
Viimeksi muokattu:
OpenAI:n uusi gpt5.6 blogipostaus julki: https://openai.com/index/gpt-5-6/ Käyttöliittymähommiiin on panostettu. Paljon myös hypeä, että pitäisi tehdä paremmin halvemmalla kuin aikaisemmat mallit
1783618186181.png

GPT‑5.6 is available starting today across ChatGPT, Codex, and the OpenAI API. The rollout is starting globally now and will continue gradually toward full availability over the next 24 hours.
 
Hyvä blogi miten bun:in tekijä porttasi clauden avulla bun:in rust:lle. Miksi, miten, paljonko maksoi. Jos on duunissa isossa firmassa ja jotain legacy-pasketta harmina niin tän blogin opeilla voipi myydä idean paremmasta tulevaisuudesta. Mikä bun, javascript runtime joka korvaa node.js:n ja alunperin kirjoitettu zig:lla.

Kuvissa vain pari juttua, blogi on pitkä ja menee yksityiskohtiin. Yksityiskohdat oleellisia, "port and make no mistakes" ei ole hyvä prompti tai toimintatapa.
1783620313604.png


Miten päästään selvyyteen onko lopputulos hyvä?
1783620352378.png


Maksoi 165k$. 11pv, 1 erittäin pätevä kooderi.
1783620524467.png

 
Viimeksi muokattu:
Hyvä blogi miten bun:in tekijä porttasi clauden avulla bun:in rust:lle. Miksi, miten, paljonko maksoi.

Kaikkea Anthropicin mainosta ei tosin ihan kannata ottaa totena.

Lyhyestihän tarina on aivan eri kuin blogissa. Zigin developerit ilmoittivat ettei Clauden tekemä koodi kelpaa heille ja samalla Anthropic osti Bunin joka käytti Zigiä. Projekti piti siis välittämättä mistään muusta portata pois Zigistä, koska se olisi huonoa mainosta Anthropicille.

Kaikki muut detailjit voi sitten lukea se kontekstina ja miettiä mikä on totta ja mikä ei.
 
Windowsille päivityksen sai lataamalla äpin uudestaan Microsoft Storesta. Jostain syystä muuta kautta sitä ei saa?

No joka tapauksessa nyt testissä 5.6 Sol medium ja ei se ainakaan nopea ole.
 
Kaikkea Anthropicin mainosta ei tosin ihan kannata ottaa totena.

Lyhyestihän tarina on aivan eri kuin blogissa. Zigin developerit ilmoittivat ettei Clauden tekemä koodi kelpaa heille ja samalla Anthropic osti Bunin joka käytti Zigiä. Projekti piti siis välittämättä mistään muusta portata pois Zigistä, koska se olisi huonoa mainosta Anthropicille.

Kaikki muut detailjit voi sitten lukea se kontekstina ja miettiä mikä on totta ja mikä ei.
ZIG on ohjelmointikieli, bun on javascript runtime. Bun:lla ja zig:lla ei ole keskenään muuta tekemistä kuin että alkuperäinen bun oli zig:lla kirjoitettu. Bun:in alkuperäinen tekijä porttas bun:in rustille claudin avulla. Blogi minkä linkkasin on alkuperäisen bun:in kirjoittajan tekemä, alkuperäinen bun:in tekijä teki rust portin claude coden avulla.

Seuraava bun:in versio eli 1.4:en on rust:lla kirjoitettu. Bun on se parempi javascript runtime jos ei halua kärsiä node.js:sta.

Sillä mitä mieltä zig:in devaajat on jostain ei ole mitään tekemistä bun:in kanssa. Suosittelen lukeen sen blogin, sieltä voi jotain oppia. On hyvinkin tarkka ja tekninen selitys mitä ja miksi.
 
Windowsille päivityksen sai lataamalla äpin uudestaan Microsoft Storesta. Jostain syystä muuta kautta sitä ei saa?

No joka tapauksessa nyt testissä 5.6 Sol medium ja ei se ainakaan nopea ole.
Mulle riitti codex quit ja uudelleen käynnistys. Sol ei tosin näy itellä, vain Terra ja Luna. Eka ajo projektiin, katotaas mitä löytää.
 
ZIG on ohjelmointikieli, bun on javascript runtime. Bun:lla ja zig:lla ei ole keskenään muuta tekemistä kuin että alkuperäinen bun oli zig:lla kirjoitettu. Bun:in alkuperäinen tekijä porttas bun:in rustille claudin avulla. Blogi minkä linkkasin on alkuperäisen bun:in kirjoittajan tekemä, alkuperäinen bun:in tekijä teki rust portin claude coden avulla.

Zig on ohjelmointikieli, jonka standard libraryyn tai kääntäjään tai muuhun Clauden koodit eivät kelpaa. Anthropic ei tästä pitänyt. Bunin kääntäminen tapahtui vasta sen jälkeen kun Anthropic osti Bunin kehittäjät.

Se olisi jäänyt kääntämättä ilman tätä ostosta. Rahalla ostettiin PR:ää.
 
Zig on ohjelmointikieli, jonka standard libraryyn tai kääntäjään tai muuhun Clauden koodit eivät kelpaa. Anthropic ei tästä pitänyt. Bunin kääntäminen tapahtui vasta sen jälkeen kun Anthropic osti Bunin kehittäjät.

Se olisi jäänyt kääntämättä ilman tätä ostosta. Rahalla ostettiin PR:ää.
Ei. Syy bun:in uudelleenkirjoittamiseen oli tietoturvasyyt ja rust:in tietoturvaa tukevat ominaisuudet. Ei joku PR-juttu. Olisivat voineet jatkaa zig-portin korjailua maailmanloppuun asti tai vaihtaa ohjelmointikieleen jolla voi tehdä helpommin koodia missä ei ole pointteri yms. virheitä. Blogissa hyvin selitetty jos haluaa asian ymmärtää.
A large percentage of bugs from that list are use-after-free, double-free, and "forgot to free" in an error path. In safe Rust, these are compiler errors and RAII-like automatic cleanup with Drop. Compiler errors are a better feedback loop than a style guide.

Koodit löytyvät open sourcesta jos epäilyttää rust-portin taso ja onko zig enää juttu tässä projektissa: GitHub - oven-sh/bun: Incredibly fast JavaScript runtime, bundler, test runner, and package manager – all in one

--

Pointti kyllä oli, että luin tuon blogipostauksen kokonaisuudessaan. Siitä voi oppia jotain jos jaksaa lukea sen sijaan että heittelee hiha-vakioita. Erittäin hyvä katsaus siihen miten ison projektin migraatio kielestä toiseen kannattaa tehdä AI:n avulla. Samat opit pätee, jos haluaa jonku tech debt legacy mokkulan modernisoida.
 
Mulle riitti codex quit ja uudelleen käynnistys. Sol ei tosin näy itellä, vain Terra ja Luna. Eka ajo projektiin, katotaas mitä löytää.
Hitaasti etenee Sol ja OpenAI on näköjään samaa mieltä, ehdottaa vaihtamista nopeampaan Terraan tai Lunaan. Pian tuon jälkeen tulikin "Selected model is at capacity. Please try a different model."
 
Viimeksi muokattu:
Ei. Syy bun:in uudelleenkirjoittamiseen oli tietoturvasyyt ja rust:in tietoturvaa tukevat ominaisuudet. Ei joku PR-juttu. Olisivat voineet jatkaa zig-portin korjailua maailmanloppuun asti tai vaihtaa ohjelmointikieleen jolla voi tehdä helpommin koodia missä ei ole pointteri yms. virheitä. Blogissa hyvin selitetty jos haluaa asian ymmärtää.

Eikö ole jännä ettei se ollut ongelma ennen kuin Anthropic antoi ison tukun rahaa ja Bunin tekijät puolustelivat Zigin valintaa Rustin sijaan ennen sitä? Mainos upposi siis täysin sinuun. Antaa sitten olla.
 
Tää oli jossain jo debunkattu feikkiuutisena, todellinen tarina oli että haluavat valvoa tarkemmin ettei firmat ja tärkeät työntekijät valu ulkomaille, mallit itsessään tarkoitus kyllä puskea maailmanmarkkinoille.
Mistä debunkkauksesta kyse? Mä näin localllama subredditissä jonkun debunkkaus yrityksen joka ei vakuuttanut kyllä yhtään, kun siinä viitattiin johonkin ihan toiseen, aiempaan kokoukseen (juristien ja proffien roundtable) kuin siihen mistä Reuters kirjoitti (kauppaministeriön johtama kokous AI-firmojen kanssa).

Ja siinä juristien ja proffien kokouksessakin oli puheenvuoroja jossa varoiteltiin uhista (valtionsalaisuudet saattaa vuotaa jos opetusmateriaaliin päätynyt arkaluontoista settiä) ja että jotain karenssia ja sandboxissa testaamista pitäisi alkaa tehdä.
 
Sol taitaa silti olla liian ahnas tavalliselle Pro-tilaukselle. Viiden tunnin tokenit paloi kahdessa tunnissa ja viikon käyttörajasta hupeni 15%. Toisaalta nyt sai ison refaktoroinnin yhdessä illassa loppuun. Toisessa taskissa käytin Sol/Terra mixiä ja saatiin paikallistettua bugi mitä on tutkittu pitkään. Molempiin on tehty paljon esityötä että ei ihan vertailukelpoinen, mutta 5.5:n kanssa piti osallistua enemmän ja miettiä ratkaisuja. Uusi 5.6 näyttäisi pärjäävän paremmin itse.
 
Ei oo ainakaan vielä tullut tota 5.6 mallia itselle codex plugariin, codex cli alkoi näkymään terra tosin, onkohan tuo SOL vain paremman pään tilauksiin?

e. testasin nyt sit tuota 5.6 terraa extra-high asetuksella muokkaamaan yhtä simppeliä dashboardia mikä mulla on, 3-4 rundia menty ja vielä korjaillaan sen tekemiä bugeja, ei ole kyllä näin paljon mallit feilannut kyllä moneen generaatioon, ei oikein vakuuta, en muista mikä malli oli viimeksi että ei olisi kerrasta toiminut max kahdesta joku yhden sivun html.
 
Viimeksi muokattu:
Codex-käyttäjille tuli ilmainen resetti niin pääsin jatkamaan. Nyt kokeilen käyttää Terraa ja tokeneita palaa ihan yhtä paljon. 20 minuuttia = 20% pois viiden tunnin limiiitistä.
 
Laitoin Solin vielä ennen nukkumaanmenoa optimoimaan 68k emulaattoria. GPT 5.5 ei sitä enää osannut optimoida, Claude vielä vähemmän, mutta Sol optimoi +33% nopeammaksi.

Luna on välillä tyhmä kuin saapas mutta xhigh tasolla ihan pätevä ajamaan testejä ja tekemään pieniä korjauksia.
 
DeepSwe päivittynyt.
Tuon perusteella tulen paljon käyttämään 5.6-sol high
1783664341676.png

Onpa uskomatonta miten paljon halvempi ajaa. Tuota 5.6:sta huhuttu että olisi 4biljoonaa parametria. gpt6 huhuissa, että olisi merkittävästi isompi malli mikä opetettu uudestaan. Jännä nähdä saadaanko loppuvuoden aikana vielä isompi hyppy mallien ja työkalujen kyvykkyydessä. ts. mikä se opus4.5 vs. ?? on loppuvuodesta ja millainen kehitys tapahtui agenttisen koodauksen ensimmäisenä vuotena
 
Oliko ultra moodi jo 5.6:ssa tarjolla? Erityisesti kiinnostaa ultra kun sen pitäisi osata aliagentteja komennella hyvin. Joko se agenttilooppi aliagentteineen hyppäisi next levelille jos on varaa selaiseen(ei ole harrasteprojektien puitteissa).

Arvelen, että deepswe:ssa taitaa puuttua sopiva vaikeuden kasvu taskeissa. Ehkä mittaa enemmän bulkkikoodausta eikä sisällä sopivia reunatapauksia missä tulisi selväksi 5.5 vs. 5.6 tai 5.6 vs. fable ero kun mennään vaikeimpiin taskeihin mitä mallit osaavat ratkoa.

codex team:lla olis AMA jos haluaa heitellä kysymyksiä heille. Suomenaikaa 19:30 alkaa
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/OpenAIDevs/status/2075395561860321412
 
Minulla Macin Codex/GPT apissa näin, mites kun max oli jossain mainostetuna myös niin sitä ei ole, vai olikohan se että max/ultra on sama.
1783681195378.png
En kyllä tiedä miten nuo menevät. OpenAI:n blogin pohjalta kuvittelin, että ultra olisi monen agentin managerointiin käytettävä asetus ja max liittyisi enemmän siihen paljon yksi agentti voi ajatella. Olisiko tuo erittäin korkea sitten max?
 
Tuo erittäin korkea taitaa olla xhigh.
Minä tuossa nostin tilauksen 100€ -> 200€ pro:ksi ja ainakin jos yhtä sessiota ajelee niin xhigh:lla riittää 5h limit yllättävän hyvin.

Tuota xhigh:lla nyt käyttänyt benchmark softaan ja kylläpä osasi ehdotella vaikka millasia asioita mitä 5.5 ei.
Tässä omat projektit menny jo 5.5:en aikaan täysin viibekoodailuksi, ei ole paluuta enää.
 

Statistiikka

Viestiketjuista
310 710
Viestejä
5 272 737
Jäsenet
83 899
Uusin jäsen
Veikko.T

Hinta.fi

Back
Ylös Bottom