AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Sieltä pitäisi tulla reset käytettäviksi päivän aikana.
Iloisesti on munkin mielestä $200 Pro tilauksen rajat kuluneet, vaan ompa aika raskasta käyttöä ollut niin tiedä sitten.

Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/thsottiaux/status/2090766694897619318?s=20

Mulle ei ainakaan putkahtanut resettiä pankkiin.

Edit. Onhan se siellä desktop-versiossa. Kännyltä kun katselee niin ei näy.
 
Viimeksi muokattu:
Olihan se sitten pakko kokeilla, että taipuuko Claude vibekoodaamaan käyttöjärjestelmää (x86-64) ihan nollista. No kyllähän tuo taipuu ja ominaisuuksiakin alkaa jo jokunen olemaan. Koodattu käytännössä kokonaan C:llä. On siellä myös jokunen rivi toki ASM:ia ja hostin puolen testityökalut sekä muut työkalut on pitkälti Pythonia.

Löytyy toki muistinhallinta (Mm. paging, virtuaalinen muisti ring 3 appeille, heap, stack, NX/W^X ja kernelillä ASLR), scheduleri (Preemptive round robin) ja jopa kotikutoinen tiedostojärjestelmä (Inodet, journalointi, block groupit, eli hieman ext3 muistuttava) koska miksi sitä nyt valmiita suoraan käyttämään. Tämä vaati kyllä jokusen version saada järkeväksi ja toimivaksi. Tuli myös tehtyä päälle oma ikkunointi, joka on pääosin Ring 3:ssa, eli user modessa. Käyttää Window Server / client mallia, joiden välillä oma protokolla. Muistuttanee jonkun verran Waylandia. Piirtoa varten on sitten vielä oma UI-kirjasto. Shelli ja terminaalikin löytyy, jossa on sitten aika paljon taas otettu mallia Unixista ihan pellin allakin. Eli pipet, redirectit, jobien hallinta ja signaali mm. löytyy. Jonkunlainen C-kirjastokin löytyy.

Aika paljon tullut opittua ihan kantapään kautta, eli jos nyt alusta tekisin niin joitain asioita lähtisin tekemään heti järkevämmin ja suunnitellummin. Useiden asioiden muuttaminen jälkikäteen on teettänyt aika paljon työtä. Eihän tässä varmasti mitään järkeä ole, mutta ollut ainakin mielenkiintoinen ja erittäin opettavainen projekti. Eli jos haluaa edes hieman oppia miten se käyttis oikeasti toimii, niin suosittelut :thumbsup:

Pääasiassa tullut pyöriteltyä QEMU:lla (Emuloituna ja KVM), mutta pyörähtää myös oikealla raudalla kun jokusen kerran on tullut sekin testattua. Eli tuota voi ajaa livenä myös muistitikulta.

1787502398031.png


Ajureita löytyy oikeastaan vain PS/2 (hiirelle ja näppikselle), IDE ATA (DMA ja PIO) ja QEMU:a varten sitten virtion ajureista blk, input, rng ja gpu. PCI:lle on myös näiden myötä tuki. Seuraavana tarkoitus katsoa saisiko leivottua ajurit USB:lle (Ja ettei liian helpoksi mene, niin xHCI) ja AHCI:lle, jotta SATA toimisi.
 
Tänään tulee 5h rajat takasin 20 tilauksiin codexiin. Ei kallimpiin.
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/thsottiaux/status/2092058556707344708

Mitähän varsinaisesti hyötyvät tästä? Ehkä sen että jää helpommin käyttämättä viikoittainen quota joka talolle tietenkin hyvä
 
Mitähän varsinaisesti hyötyvät tästä? Ehkä sen että jää helpommin käyttämättä viikoittainen quota joka talolle tietenkin hyvä
5 h raja kelpaa tälläiselle tuhlaajapojalle. Muutenkin kun 20 € tilauksella vetäisee ultralla jonkun projektin, ni se on 3-4 tuntia ja viikon saldot on puhki.

Muutenkin 5 h breikki pakottaa tehdä jotain ehkä jotain muutakin kun istua terminaalin ääressä. Ainakin vaikka suunnittemaan seuraavia featureita syvemmin jos ei muuta :btooth:
 
Tää on kyllä ihan sieltä ja syvältä. yhden pikku promptin laittaa niin menee 20prossaa käytöstä. hohhoijaa. ois halunnutkaan yöllä nukkua.
 
Tää on kyllä ihan sieltä ja syvältä. yhden pikku promptin laittaa niin menee 20prossaa käytöstä. hohhoijaa. ois halunnutkaan yöllä nukkua.
En tiedä mitä meinaat tolla nukkumisella. Mut voithan promptata että tarkkailee 5 h limittiä. Kun 10 % jäljellä laittaa itsensä odotustilaan (tekee itselleen palvelun tms.) kunnes limiitti jälleen 100 % (jota pollaa vaikka aina 15 min. välein) ja sitten jatkaa automatiq.
 
Openai huhuissa astran jälkeen tuleva 10biljoonaa+ parametria malli olisi ohittanut pre training vaiheen. Pre trainingin jälkeen ajetaan vahvistusopetusta yms. Realistisesti kertoo siitä, että uusia malleja tulee melko tiheällä tahdilla. Arvelisin, että alkuvuodesta 2027 tämä uusi iso malli ulkona.

Mielenkiintoista nähdä mikä on koodausavustimien kyvykkyys astra ja bel malleilla + uusilla haarniskoilla.
 
Viimeksi muokattu:
Mikä tämä ihmeen "haarniska" suomennus näiden mallien kanssa on, eikö kyse kuitenkin ole valjaista? Tökkii pahasti korvaan/silmään vs. alkuperäinen englanninkielinen teksti :)
 
Lopultakin tyrkytti SuperGrok 3kk yhden hinnalla, joten testiin. Ei oikein vakuuta, käyttöraja tuntuu melko pieneltä ja ainakin aliagenttien kanssa sekoilee, kahdesti kadotti tehdyt muutokset. Ihan hyvin kyllä koodailee, voisin subata tämänkin, jos käyttöä olisi huomattavasti enemmän, nyt vähän tuntuu, että onko tämä edes tuolla kympillä/kk hyvä diili.
 
Mikäs on mielipide koodausagenttien etäkäytöstä puhelimella? Millä agentilla etäkäyttö toimii parhaiten? Olen itse OpenCodeen tykästynyt muutoin, mutta webui Tailscalen kautta on vähän kankea vaikka sinällään ajaa asiansa ihan ok.
 
Codex toimii hienosti remotella, usein tulee laitettua sieltä esim seuraava vaihe käyntiin.
Muista etäkäytöistä ei kokemusta.
 
Kylläpä on ikävä muutos tuo, kun OpenAI ei anna enää käytön jatkua 0% jälkeen. Seuraavaksi taitaa lähteä ChatGPT:n "loputon" käyttö, kun sitäkin väärinkäyttävät jatkuvasti enemmän. Kai tässä täytyy itselläkin laittaa MCP ja ottaa ilo irti vielä kun voi. Miksei sitä voi vain olla hiljaa, jos keksinyt keinon abusettaa itselleen loputtoman käytön? :smoke:
 
Seuraavaksi taitaa lähteä ChatGPT:n "loputon" käyttö
Kiristykset ilmeisesti jo alkaneet, valittaa jatkuvasti miten "execution time limit" esti sitä ja tätä. Katselin läpi aikoja ja jarrut menee pohjaan aina 15/20/25 min kohdalla, testailevat kuinka alas sen voi laittaa?
 

MiniMax Week​

Generative video and frontier reasoning. MiniMax M3, M2.7, Speech 2.8, and Music 3.0 are free for fourteen days. An AI feast for fourteen days.
Älkää kaikille mainostako, pyörii jo tarpeeksi hitaasti. :smoke:
 
Onkohan sinulla jokin asetus väärin? Ainakin tuo M3 toimii hyvin, agentti jauhanut 24/7.
Tuosta siis yritän: Sign In | GMI Cloud
Olen kirjautuneena sisään, joka kerta välittömästi tulee toi herja. Tuntuu että ihan sama mitä asetuksia, promptia tai sen pituutta säätää.
Edit: jaahas, se ei anna jättää lyriikoita tyhjäksi vaikka tekee instrumentaali sen... Eli toimiihan se.
 
Tuossa kun Codex kieltäytyy oman koodin kanssa turvallisuus tarkistuksista, niin se tarjos että tunnistaudu ja niinhän tein.
Jos nyt voisi edes omasta koodista kysellä jotain.

1788182155707.png
 
Codexin 5h ja viikkoraja on tällähetkellä ihan rikki. Sol kielimallilla saa jotain 30 min kerrallaan ja sitten vielä katkaisee contextin lopuksi. Viikkorajaa ei edes ehdi käyttää nollaan, kun se antaa tehdä niin vähän kerralla. Ainakin seuraava kuukausi mennään Claudella.
 
ite otin eilen clauden ja en oo näin iloinen ollut pitkään aikaan koodauksen sujumisen kanssa. on pikkusen parempi koodin kanssa kun codex. nyt claude auditoi ja suunnittelee ja codex toteuttaa ja claude tarkistaa. ja itse suunnittelen chat gtp:n kanssa. pitäs vielä laittaa automaattiseksi tuo homma clauden ja codexin välille.
 
Mitä valjaita käytätte ja jos teette selainsoftaa, miten annatte selaimen käyttöön? VSCodella, joka ilmeisesti claude code taustalla, sisäinen selain ei tunnu toimivan aina ja chrome devtools mcp ei käynnisty. Joskus pyyntö testata selaimella käynnistää chromen mutta valitettavan usein ilmoittaa vain että ei onnistu käynnistämään selainta.

Toinen ongelma on kurittomuus. Olen antanut henkilökohtaiseen claude.md tiedostoon tarkat ohjeet, mutta malli lipsuu niistä usein. Pyytäessä korjausta malli pyytää anteeksi ettei lukenut ohjeita.

Onko tietoa mikä järjestys on user claide.md, repo claude.md, skills, memory ja muut ohjeet? Mielestäni on erittäin sekavaa kun ohjeistuksia saa jakaa joka puolella, eikä käytännössä tiedä mitkä on ehdottomia.
Harnessiin pitäisi saada määriteltyä säännöt jotka on totaalisen rajaavia ja joita se vahtisi.
Esim. kun ai ei saanut projektia kääntymään alkoi se kerran etsiä ympäristömuuttujista access tokenia, jonka löysikin ja tyrkkäsi urliin parametrina. Aika röyhkeää.
 
Onko tietoa mikä järjestys on user claide.md, repo claude.md, skills, memory ja muut ohjeet? Mielestäni on erittäin sekavaa kun ohjeistuksia saa jakaa joka puolella, eikä käytännössä tiedä mitkä on ehdottomia.
Harnessiin pitäisi saada määriteltyä säännöt jotka on totaalisen rajaavia ja joita se vahtisi.
Riippuu mallista/päivästä/kuun asennosta miten hyvin nämä noudattaa ohjeita. Ehdottomia ohjeita on käytännössä mahdotonta antaa. Epävarmuuden kanssa pitää vaan oppia elämään jos näitä käyttää.
 
Mitä valjaita käytätte ja jos teette selainsoftaa, miten annatte selaimen käyttöön? VSCodella, joka ilmeisesti claude code taustalla, sisäinen selain ei tunnu toimivan aina ja chrome devtools mcp ei käynnisty. Joskus pyyntö testata selaimella käynnistää chromen mutta valitettavan usein ilmoittaa vain että ei onnistu käynnistämään selainta.
En ole selainta käyttänyt, mutta oli samantyylinen ongelma amiga-emulaattorin kanssa. Mulla ratkesi siihen, että teetätti skriptin + parametrit skriptille millä käynnistetään. Tämä oli parempi kuin skill kun on minulle myös helppo käyttää skriptiä haarniskan ulkopuoleltakin. Jos vaihdan työkalusta toiseen niin skriptit säilyvät toisin kuin haarniskakohtaisesti implementoidut toteutukset.

Toinen ongelma oli agentin nähdä mitä appsissa tapahtuu. Ikkunan koko+sijainti, joku toinen ikkuna peittää osan jne. ja kuvaruutukaappaus ei toimi. Tämä ratkesi käyttämällä obs:ia kaappaamaan ikkuna + agentti kirjoitti obs:in websocket rajapintaa vastaan kuvankaappauksen ikkunasta. OBS osaa kaapata oikein kuvan vaikka ikkuna olisi minimoitu/osittain toisen ikkunan takana tms. Samalla api:lla saa myös obs:in konfiguroitua. Agentti osasi kaiken obs:iin liittyvän tehdä itsekseen ja hyvä tuli. Selaimen kanssa toki pääsee pitkälle ilman ui:ta, mutta jos jossain kohtaa haluaa myös verifioida visuaalista ulkoasua eri selaimilla,...
 
Anthropic kertoilee system card:ssa, että deepswe1.1 olisi rikki ja tämän vuoksi fable5.1 sai huonommat pisteet kuin parhaat aikaisemmat mallit. reddit näyttää aika positiiviselta fable5.1:en suhteen

DeepSWE is a set of 113 long-horizon software engineering tasks built to measure thecapabilities of frontier coding agents. The tasks are diverse, reflect real-world complexity,and are written from scratch to avoid benchmark contamination. Fable 5.1 scored anaverage of 67.4% over five trials.

A note on scoring: DeepSWE grades each task with hidden tests that are often written for asingle reference solution. When we reviewed failing transcripts, we found that Fable 5.1implemented some ambiguous tasks more thoroughly than the task required, for exampleby validating inputs and raising exceptions, or by keeping new code consistent withcodebase conventions. This resulted in equally valid or more rigorous implementationsfailing the hidden tests.

Samantyylistä juttua myös frontiercode benchmarkista
A note on why Fable 5.1’s score falls at high effort and above: FrontierCode grades eachtask on task correctness and scope. Because the evaluation is designed around producingmergeable diffs without human edits, any change to a file outside of the task’s scope isconsidered a failure, even when the change is correct or helpful. This scope criterionexplains both Fable 5.1’s decline at higher effort and its gap compared to Fable 5. At low andmedium effort, Fable 5.1 scores slightly above Fable 5 on both subsets, and its pass rate ontask-correctness criteria keeps rising with effort.

Eletään aikaa missä numero kertoo yhä vähemmän kun benchmarkit eivät ole täydellisiä. Pisteet anthropic:lle kun eivät ole lähteneet keinotekoisesti optimoimaan benchmark-numeroita paremmaksi vaan reilusti että huono numero esille ja selvitelty syitä taustalla.
 
...implemented some ambiguous tasks more thoroughly than the task required.. any change to a file outside of the task’s scope isconsidered a failure, even when the change is correct or helpful..
Kuinka tarkasti nuo benchit määrittää mitä pitää tehdä? Tuommoinen käytös ihan hyvä, jos vetää 100% vibeillä, mutta jos speksaan tarkasti, että tee jotain main.c ja tuloksena on se muutos ja 7 ylimääräistä muokkausta kyseessä on ongelma.
 
Codexin 5h ja viikkoraja on tällähetkellä ihan rikki. Sol kielimallilla saa jotain 30 min kerrallaan ja sitten vielä katkaisee contextin lopuksi. Viikkorajaa ei edes ehdi käyttää nollaan, kun se antaa tehdä niin vähän kerralla. Ainakin seuraava kuukausi mennään Claudella.
Samaa mieltä. Pro-tilaus plus on käytännössä hyödytön tällä hetkellä. Claudella mennään. Pelkän projektin dokumentaation orientaatio ennen aloitusta syö 5 h budjettia liikaa, puhumattakaan että jotain pitäis vielä alkaa tekemään.
 
Viimeksi muokattu:
Kuinka tarkasti nuo benchit määrittää mitä pitää tehdä? Tuommoinen käytös ihan hyvä, jos vetää 100% vibeillä, mutta jos speksaan tarkasti, että tee jotain main.c ja tuloksena on se muutos ja 7 ylimääräistä muokkausta kyseessä on ongelma.
Kyllähän tuosta jää kuva, että AI korjailee/muuttelee asioita mitä testin tekijä ei ole ajatellut muutettavaksi. Se mikä tässä mun mielestä oli anthropicin puolelta hyvää, että reilusti huonompi numero esiin ja selitys miksi näin. Joku toinen firma olisi voinut optimoida haarniskaa/kielimallia benchmarkkia varten ja lopputuloksena iso numero mikä ei heijastele todellisen maailman suorituskykyä.
 
Kyllähän tuosta jää kuva, että AI korjailee/muuttelee asioita mitä testin tekijä ei ole ajatellut muutettavaksi. Se mikä tässä mun mielestä oli anthropicin puolelta hyvää, että reilusti huonompi numero esiin ja selitys miksi näin. Joku toinen firma olisi voinut optimoida haarniskaa/kielimallia benchmarkkia varten ja lopputuloksena iso numero mikä ei heijastele todellisen maailman suorituskykyä.
Tästä toivoisi kyllä vähän tarkempaa tietoa. Tuo että muutellaan ulkopuolisia tiedostoja voi olla neutraali asia, tai ihan hanurista. Avulias Claude saattaa esim. hyvää hyvyyttään korjata käytettävästä kirjastosta jonkin bugin, mutta samalla sitten rikkoa jotain mikä käytti samaa kirjastoa.
 
Se mikä tässä mun mielestä oli anthropicin puolelta hyvää, että reilusti huonompi numero esiin ja selitys miksi näin.

Tosin, piilotettuna vain tuohon korttiin. Nuo numerothan on piilotettu itse PR osuudesta ja blogeista jotka taas ovat ne, joita ihmiset eniten lukevat. OpenAI julkaisi aikanaan samanlaisen kannanoton, taisi olla kyse Terminal Benchistä jossa lopputulokset voivat olla vääriä ja osa agenteista saa sen takia paremmat pisteet kun tekevät väärin (Anthropic siinä tapauksessa), eli eihän tässä mistään uudesta ilmiöstä ole kyse. Nythän Anthropic julkaisi iloisesti Terminal Bench 4.0:n heille sopivana numerona.

Toisekseen, jos agentti koskee asioihin joita sen ei pitäisi promptin mukaan mennä muokkaamaan, niin kyllähän siitä miinusta pitäisikin tulla.
 
Codexissa näyttää että kokonais tokenit 31,2 miljardia. Käytännössä kaikki tämän vuoden.
Noista ei selviä suoraan input/output suhdeita ,mutta pyysin sitä itseään laskemaan paljonko olisi maksanut nuo 5.6-sol vs Claude Opus 5.

Laski sitten miten päin vaan, niin huh sentäs mitä nuo tokenit olisi API tokeneina maksaneet, voiko nyt laskelmat edes pitää paikkaansa.
Taitaa katteet olla kohdallaan noissa API tokeneissa, kerran pro tilauksilla tälläisiä saa.

1788346789348.png
 
Codexissa näyttää että kokonais tokenit 31,2 miljardia. Käytännössä kaikki tämän vuoden.
Noista ei selviä suoraan input/output suhdeita ,mutta pyysin sitä itseään laskemaan paljonko olisi maksanut nuo 5.6-sol vs Claude Opus 5.

Laski sitten miten päin vaan, niin huh sentäs mitä nuo tokenit olisi API tokeneina maksaneet, voiko nyt laskelmat edes pitää paikkaansa.
Taitaa katteet olla kohdallaan noissa API tokeneissa, kerran pro tilauksilla tälläisiä saa.

1788346789348.png
70-80% marginaalin arvelevat netissä anthropic:lla olevan. Pian IPO niin asia selviää virallisemmin.
 
Codexissa näyttää että kokonais tokenit 31,2 miljardia. Käytännössä kaikki tämän vuoden.
Noista ei selviä suoraan input/output suhdeita ,mutta pyysin sitä itseään laskemaan paljonko olisi maksanut nuo 5.6-sol vs Claude Opus 5.

Laski sitten miten päin vaan, niin huh sentäs mitä nuo tokenit olisi API tokeneina maksaneet, voiko nyt laskelmat edes pitää paikkaansa.
Taitaa katteet olla kohdallaan noissa API tokeneissa, kerran pro tilauksilla tälläisiä saa.

1788346789348.png
Itsellä on töissä API token pohjainen enterprise tilaus ja tuota luokkaa ne hinnat tosiaan on. Ei todellakaan pysty tuollaisia määriä käyttämään :)
 
Laski sitten miten päin vaan, niin huh sentäs mitä nuo tokenit olisi API tokeneina maksaneet
Absurdi fiilis, jos käyttää jotain, joka näyttää API-hinnan, painaa enter ja voi lähes nähdä kuinka setelit alkaa palamaan. Tässä illasta pyörinyt Luna xhigh & Grok 4.6 low, kaikki työt tehty ilmaisilla M3, en kyllä tämmöistä maksaisi siitä mitä saaneet aikaan:
1788347439283.png

Sol päällä lasku olisi varmaankin $850 :psmoke:
 
Absurdi fiilis, jos käyttää jotain, joka näyttää API-hinnan, painaa enter ja voi lähes nähdä kuinka setelit alkaa palamaan. Tässä illasta pyörinyt Luna xhigh & Grok 4.6 low, kaikki työt tehty ilmaisilla M3, en kyllä tämmöistä maksaisi siitä mitä saaneet aikaan:
1788347439283.png

Sol päällä lasku olisi varmaankin $850 :psmoke:
Pari päivää tässä käyttänyt lähinnä Sol High 1M kontekstilla ja ei se nyt kovin ahnaasti näytä rahaa polttavan, ainakin toistaiseksi tuntuu olevan about samaa tasoa kuin esim. Claude Sonnet 4.6.
 
Kovia huhuja, että huomenna tulisi GPT Astra. Siitä jo juttuja miten kova cybersecurityssä(100% benchmarkkeja), vaan eipä me tavalliset käyttäjät päästä näkemään se muuten kuin kieltäytymisien muodossa.
 

Statistiikka

Viestiketjuista
314 704
Viestejä
5 340 689
Jäsenet
84 879
Uusin jäsen
Lenni_niemi

Hinta.fi

Back
Ylös Bottom