AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Tullu tehtyä mm.
Garminiin ja Chromeen appejä
Kokonaisvaltainen videon esikäsittelylaitos
Davinci Resolveen ajanseuranta pluginin, exportilla josta näkyy veloitettava summa ja missä aika käytetty projektin sisällä
Omiin kotireeneihin progressiivistä overloadia automaattisesti lisääävän apin
Motion graphicsin automatisointai promptaamalla, joka toimii oikeasti itselle yhtä hyvin kuin perus jutut joita jouduin ennen vääntään After Effectsissä -> nyt vaan promptaa ja duunaa jotain muuta järkevää sillä välin kun ruksuttaa.
Omakotitalon papereita yms. dokumentointia varten oma appi, missä automatisointia ylläpitoon liittyen.
Tuo kiinnostaisi (omakotitalon papereita), voitko kertoa lisää? Olis myös tarvetta itsellä, just alannut katselemaan jos löytyis jostain
 
Kiitos tästä, otan luettavaksi.

Ihan vielä en oo varma missä määrin haluun tän kanssa työskennellä, vähintään jatkaa omien työkalujen kehittämistä ja turvata omaa osaamista tässä.
Mielenkiintona olis kyllä edetä työpaikkaan, jossa tätä kehitystä kannustettaisiin enemmän niille jotka ovat siihen kykeneviä. Paljon jää automatisoimatta systeemejä perus IT työssä, kun siiloutuneiden ryhmien ongelmia vois sieltä ryhmien sisältä lähteä alustamaan omilla ratkaisuilla AI:ta hyödyntäen. Sen jälkeen vois oikeat koodaajat tarvittaessa tsekkaa et mitä toimintoja nää ryhmät tarvii kun olis alustava softa alla.
Minkälainen IT-alan pohjakoulutus sulla on? Siis jos töihin mielit.
 
Meillä jotkut ei-koodarit tekee omia aputyökaluja AI:lla kun eivät osaa itse koodata, eikä kukaan muu pysty/ehdi auttamaan.
 
Anthropic ostaa 2GW edestä amd:lta mi450+helios:sta. Eka gigawatti pitäisi olla tuotannossa h12027. Alkaa kapasiteetti lisääntymään kun noi helios+mi450:et on ihan sairaan nopeita. OpenAI:lle pitäisi mennä 1GW tänä vuonna heliosta jos viime vuoden pressijulkaisut pitävät edelleen paikkansa. Nvidialta toki myös rubinit pian konesaleissa ja kapasiteettia sitäkin kautta lisää, ei pelkkä amd myymässä.
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/AMD/status/2079916944325525799


Saapa nähdä kärsitäänkö vielä ensi kesänä pulaa koodaustokeneista vai ylitarjonaa. Kapasiteetti lisääntynee myös sitä kautta kun spacex/google/microsoft saanevat vähintään gpt5.6 tason mallit tuotantoon vuoden sisään.
 
Viimeksi muokattu:
Tuo kiinnostaisi (omakotitalon papereita), voitko kertoa lisää? Olis myös tarvetta itsellä, just alannut katselemaan jos löytyis jostain
Tässä pieni demo screenshot. Tiedot täysin keksitty vaan testikäyttöön.

Käytännössä oli ajatus kun sain paperit omakotitalosta missä oli dokumentoitu KAIKKI -> digitalisoi, muunna haettavaan formaattiin, mahdollisuus lisätä kuvia, videoita, yms kaikista vanhoista ja uusista kunnostuksista.
Meinasin alkuun puhelimella skannata vaan kuvat ja laittaa johki paperless-ngx mutta sit tuli ajatus tehdä yhtenäinen paikka kaikelle datalle, muistutuksille kausittaisista ja kuukausittaisista tehtävistä, dokumentoida laitteiden esim ilp takuut, milloin "tekninen käyttöikä" on mennyt yli per missäkin, karoittaa kuukausikuluja tuonne jne jne.

Tänä kesänä maalasit seinät? Kuva, tiedot ja aikajanalle talteen -> mahdolisuus exportata joku kiva datapötkö jos myyn talon joskus.

demo.png
aikajana.png
 
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://www.youtube.com/watch?v=rt-eXisy71E


Kesän peliprojekti. Täysi path tracing, ja toimii tällä hetkellä vain Nvidian RTX-korteilla. Jos saan jostain jonkun modernin AMD:n kortin, niin yritän mahdollisesti saada sen niiden Ray Reconstructionin ympättyä myöhemmin.
 
Poolside kehittänyt 118B parametrin mikä saa 40% deepswe:ssa. Kuuntelin spoilerin podcastin missä poolsiden perustaja kertoo mallista ja tulevaisuudesta. Malli opetettu fp8:lla kun heillä on vain hoppereita käytössä. Mainitsi että tulevaisuudessa tekevät nvfp4 opetetun mallin kunhan saavat uudempaa rautaa käyttöön. Sanoi myös, että malli ei ole vielä lähellekään niin hyvä kuin voisi olla. Tämä lienee paras realistisella kotikoneella(128GB gpu muisti) ajoon saatava koodausmalli.

Optimistina laskee 1+1+1 niin ehkä rtx pro 6000:en 96GB muistilla ja nvfp4 mallilla voisi olla vuoden/kahden sisään oikein hyvä bulkkikoodaukseen kunhan on hyvä haarniska ja parempi malli speksaamassa. Samassa podcastissa tyyppi puhui, että ehkä saturaatiopiste missä parempaa ei tarvi voisi löytyä kymmenen triljoonan parametrin mallin kohdilta. Toki olettaa, että tuo malli olisi paljon paremmin tehty ja opetettu kuin nykyiset mallit.

Laguna S 2.1 is a 118B total parameter Mixture-of-Experts (MoE) model with 8B activated parameters per token and supports a context window of up to 1M tokens in thinking and no-thinking modes. It went from the start of training to launch in under nine weeks, and on long-horizon coding benchmarks it holds its own against models many times its size
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://www.youtube.com/watch?v=9_0hs2sxHHo

1784906930071.png
 
Viimeksi muokattu:
Anthropicin vastaisku koodausrintamalla. Opus5 julkaistu, samanhintainen mutta parempi kuin opus4.8. Anthropicin käppyrää hinnasta kun tuijottelee niin openai taitaa olla edelleen edellä hinta/laatu koodailussa. DeepSWe 68.8%. Ehkä fablea ei niin tarvikkaan normikäytössä?

Tuo arg-agi 3 suorituskyky on kiinnostava. Voi kääntyä jännittäviksi kyvyiksi tehdä ohjelmistoissa arkkitehtuuria/debuggausta/...
1784914101315.png

1784914227753.png


 
Viimeksi muokattu:
On näköjään Grok 4.5 kans tuolla deepswe:ssä, 5.6-sol medium halvempi ja parempi kuin se high:lla.
 
Anthropicin vastaisku koodausrintamalla. Opus5 julkaistu, samanhintainen mutta parempi kuin opus4.8. Anthropicin käppyrää hinnasta kun tuijottelee niin openai taitaa olla edelleen edellä hinta/laatu koodailussa. DeepSWe 68.8%. Ehkä fablea ei niin tarvikkaan normikäytössä?
Toivottavasti Amazon saa Claude 5:n tänä vuonna käyttöön...

Miten nuo $100 ja $200 tilaukset vertautuvat OpenAI:lla ja Anthropicilla?
 
Erilaisia AI-tehostimia ilmestyy nyt runsaasti. Lupaukset ovat kovia ja tulee mieleen moottorien lisäaineet: Osta 10 eurolla litkua niin säästät 2 euroa polttoainekuluissa.

Mutta tämä ehkä näyttää toimivan:
 
Erilaisia AI-tehostimia ilmestyy nyt runsaasti. Lupaukset ovat kovia ja tulee mieleen moottorien lisäaineet: Osta 10 eurolla litkua niin säästät 2 euroa polttoainekuluissa.

Mutta tämä ehkä näyttää toimivan:
Mielenkiinnolla odotan miten openai/anthropic ratkoo tuon ongelman. Tuleeko joku koodin indeksointi mcp-serverin taakse työkaluun vai ihan toisessa ääripäässä next gen llm ei vaan tarvitse tuollaista kun muisti+prosessointi parempi kuin nykyisissä malleissa.

Tietty se, että jos pitäis anthropicin claudecodeen tehdä joku tuollainen niin olis haastava kun pitäisi tukea kaikki mahdolliset ohjelmointikielet versus jos minä teen vain c/c++ projektia niin voin jonku c/c++ optimoidun härpättimen asentaa auttamaan llm:aa ilman että tarvii miettiä rust, python, javascript jne jne jne.
 
Viimeksi muokattu:

Opus 5 versio tuli ulos, lupaavat monelta osin about fable 5 tasoista työkalua.

Claude codella olen vähän päässyt testailemaan mutta vaikea vielä sanoa missä tämä oikeasti istuu, tokeneita tuntuu syövän aika paljon ja on varmasti kalliimpi kuin SOL, limitit paukkuu paljon nopeammin kuin solilla.
 
Anthropicin vastaisku koodausrintamalla. Opus5 julkaistu, samanhintainen mutta parempi kuin opus4.8. Anthropicin käppyrää hinnasta kun tuijottelee niin openai taitaa olla edelleen edellä hinta/laatu koodailussa. DeepSWe 68.8%. Ehkä fablea ei niin tarvikkaan normikäytössä?
Benchmarkien perusteella kyllä, mutta yksittäisissä prompteissa voi silti olla tilanteita, joissa Anthropicin malli suoriutuu OpenAI:n mallia paremmin tai kustannustehokkaammin.

Jos katsotaan tavallisen asiakkaan näkökulmasta ja vertaan Opus 5:tä ja Fable 5:tä, herää kysymys: miksi käyttäisin Fable 5:tä, jos Opus 5 on lähes kaikissa benchmarkeissa edellä? Miksi tarjota mallia, joka maksaa noin kaksi kertaa enemmän, mutta tarjoaa keskimäärin vain noin prosentin paremman suorituskyvyn?:hmm:
 
Meillä jotkut ei-koodarit tekee omia aputyökaluja AI:lla kun eivät osaa itse koodata, eikä kukaan muu pysty/ehdi auttamaan.
Tätä tulee itsekin harrastettua, kun on jotain usein toistuvia pikku työvaiheita. Sen sijaan, että tekisi suoraan homman AI:lla kannattaa toisinaan teettää skripti asian hoitamiseen. Sen jälkeen ei pala tokeneita siihen ja lopputulema on jatkossa aina tismalleen sama.
 
Tuolla Codexin Security toiminnolla ei käytännössä pysty tekemään mitään.
Tässä ensin yritin Codexilla tehdä Cloudflare Drurable Object softaan tarkistusta, että onko siinä aukkoja/väärinkäyttömahdollisuuksia -> kieltäytyi.

Seuraavaksi laitoin Kimi K3 MAX:lla ja se teki mulle listan ja korjattiin sekä commitoitiin.

Sitten pyysin Codex Security pluginniä tekemään reviewin sille commitille, että olivatko korjaukset aiheellisia jne niin siihenkin tuli:
1784968959606.png

Tietysti estetään väärinkäyttö, mutta ei myöskään Codexilla voi tehdä tällä hetkellä turvallista koodia kun se ei saa kertoa käyttäjälle mikä siinä on huonoa.
 
Entä jos kysyy "miten parantaisit luotettavuutta väärinkäytöksiä vastaan" tms?
Yritin muotoilla mahdollsiimman erilailla muutaman kerran että esim parannetaan turvallisuutta jne eli en suinkaan noin "tylysti" kysellyt kuin mitä tuohon laitoin aiemmin, mutta seis meni kuitenkin sitten cybersecurity vaatimusten takia.

Nämä kiinamallita taitaa olla nykyään sitten näitä Cyberturva malleja kun tekevät ihan mitä vaan pyytää, hyvässä ja huonossa.

edit: ja tosiaan herkässä on kun ihan puhdas commit review menee blokkiin kun se sisältää turvallisuuskorjauksia/mahdollisia jääviä reikiä mitä se ei saa kommentoida.
 
Clean Code kirjan tekijän paasausta agenttisesta koodaamisesta allelinkatulla videolla. Oli ihan viihdyttävä ja tietopitoinen pläjäys. Ei sisällä mitään tajunnanräjäyttävää uutta tietoa. Ihan hauska kuitenkin oli kuunnella mitkä asiat hepun mielestä oleellista, mikä ei. Hauska nähdä että "eläkeläisetkin" vielä jaksaa eikä vain 20v somepersoonia kertomassa miten asiat ovat ja kuinka startupeissa pörisee.
02:53 - What has changed and what has not
05:41 - The rising abstraction line
08:00 - Walking away from the code
11:15 - Agents and larger systems
14:16 - Clean code when agents write code
20:09 - Design sense and agent judgment
22:36 - Why beginners still need code
34:57 - What product engineering means
41:18 - Homework: try SwarmForge
Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://www.youtube.com/watch?v=RxxxGkFIUJ0
 
AMD kertoo, että optimoivat esimerkiksi piirien käskyistä AI:lle helpommin ymmärrettävät julkiset dokumentaatiot. Ideana, että julkisella datalla koulutetut llm:t tekisivät parempaa koodia amd:n gpu-raudalle. Fiksu idea, julkaise hyvät speksit ja anna frontier pajojen optimoida mallit. Lieköhän nähdään jotain samantyylistä ms/apple/google rintamalla missä ainakin julkisten rajapintojen kuvaukset tehtäisiin AI ystävällisiksi(jos eivät ole jo). AMD myös julkaisi oman rocm.ai devausalustan auttamaan ai-avusteista koodintekemistä.

Qt frameworkkiin tuli jotain ohjeita yms. agenteille myös. Tosin en usko, että Qt säilyy hengissä AI koodauksen aikakaudella. Se tuntuu tarpeettomalta kun voi hyvin tunnottomasti tehdä ja ylläpitää natiiviversioita, cross platform ei ole enää ongelma.

AMD:n idea mun mielestä hyvä. Tätä samaa voisi miettiä sovellettavaksi esim. julkisen tietojärjestelmien määrittelyjen ja hankintapyyntöjen kanssa,...

“For every generation of AMD GPUs, we have published not just the ISA spec. We actually publish the machine-readable ISA,” said AMD corporate VP of AI software and solutions Anush Elangovan, adding that as a result, “the frontier models are very, very capable of programming to AMD’s hardware.”
With ROCm.AI, AMD hopes to streamline this capability. The platform plugs into existing code assistants running on frontier models and provides them with the tools and documentation necessary to deploy, debug, and optimize models and serving frameworks for AMD Instinct hardware.
“We want to give you the ability to eke out the maximum performance,” he said. “This makes it incredibly easy for anyone to consume, debug, profile, and deploy.”

To further improve this process, AMD says that it’s leaning on its close relationship with AI model houses like OpenAI and Anthropic to ensure their models are trained to better understand the inner workings of both their hardware and software.
 
Machine readable ISA on ilmeisesti "vain" XML-tiedosto:

XML:
<instruction_set target="CDNA3">
  <instruction name="V_MOV_B32" opcode="0x00000001" encoding_format="VOP1">
    <description>
      Move 32-bit data from a vector or scalar input into a vector destination register.
    </description>
    <operands>
      <operand name="VDST" type="VGPR" access="WRITE" bit_offset="17" bit_width="8" />
      <operand name="SRC0" type="SGPR_VGPR_IMM" access="READ" bit_offset="0" bit_width="9" />
    </operands>
    <encoding>
      <field name="ENCODING" value="0x7E00" mask="0xFE000000" />
      <field name="OP" value="0x1" mask="0x01FF0000" />
    </encoding>
  </instruction>
</instruction_set>

Ihminenhän lukee mieluummin taulukoita, jotka taas ovat tekoälylle sellaisenaan hankalia.
 
Anthropic poistanut system prompt:sta 80% tarpeettomana. Uudet ohjeet blogissa miten kannattaisi claudea ohjeistaa ja promptata. Ihmistä jos projisoi niin tuntuu siltä kuin ohjeistus menossa juniorin opastamisesta kohti perus softatdevaavaan ohjeistamista. Enemmän miksi/mitä ei miten ohjeita.

Etenkin esimerkit näemmä paha, kun se voi rajoittaa mallin tuottamaan esimerkin mukaista sen sijaan, että löytäisi parhaan mahdollisen ratkaisun.
The number one rule for tool usage was to give Claude examples on how to use them. With our newest models, we’ve found that giving examples actually constrains them to a certain exploration space.
6a63620bedb2b7813b107213_3979f6a1.png

 
Viimeksi muokattu:
Ei tuo mikään maailman tarpeellisin tosiaan ole, mutta sellainen ominaisuus siinä on että siinä voi seurata valojen perusteella kuutta Codex-agenttia yhtäaikaisesti. Agenttikohtainen valo muuttuu vihreäksi kun agentti on valmis, keltaiseksi kun se kysyy jotain, punaiseksi jos homma menee pieleen jne. Ja noita voi toki kustomoidakin.

Vähän keräilymielessä tuli itelle hommattua, kun ensimmäinen OpenAI brändätty fyysinen laite ja noita oli vain päivän ajan myynnissä eikä ilmeisesti lisää tehdä. Mukana tuli myös erittäin tarpeelliset OpenAI keycapit :)

1785347368051.png
 
Claudella palvelut kyykkäilee näköjään. Yöllä piti pistää hommat tauolle kun ei mallit vastaillut, nyt sitten ainakin Opus 5 vielä nurin.
 
Claudella palvelut kyykkäilee näköjään. Yöllä piti pistää hommat tauolle kun ei mallit vastaillut, nyt sitten ainakin Opus 5 vielä nurin.

On kyykännyt monta kertaa viime aikoina. Se on jännä miten tuo "Government" puoli pysyy tolpillaan vaikka muilla kyykkää..
1785395580512.png
 
Kaikesta hypestä huolimatta Fable 5 on kyllä oman kokemuksen mukaan edelleen aika surkea malli monimutkaisempien ongelmien ratkaisuun. Kallis käyttää, mutta tekee silti virheitä jatkuvasti. Kehitys näyttää jo hidastuneen näissä uusissa malleissa, kun ei tämä tunnu edes paljon paremmalta kuin Opus 4.6 oli aikanaan ennen kuin sitä huononnettiin. Opus 5 taas tuntuu jopa huonommalta kuin Opus 4.8, en ymmärrä miten se pärjää testeissä niin hyvin. Viime vuonna näissä oli hurjaa kehitystä, mutta sen jälkeen en ole ainakaan omassa käytössä nähnyt edistystä juuri ollenkaan.
 
Kaikesta hypestä huolimatta Fable 5 on kyllä oman kokemuksen mukaan edelleen aika surkea malli monimutkaisempien ongelmien ratkaisuun. Kallis käyttää, mutta tekee silti virheitä jatkuvasti. Kehitys näyttää jo hidastuneen näissä uusissa malleissa, kun ei tämä tunnu edes paljon paremmalta kuin Opus 4.6 oli aikanaan ennen kuin sitä huononnettiin. Opus 5 taas tuntuu jopa huonommalta kuin Opus 4.8, en ymmärrä miten se pärjää testeissä niin hyvin. Viime vuonna näissä oli hurjaa kehitystä, mutta sen jälkeen en ole ainakaan omassa käytössä nähnyt edistystä juuri ollenkaan.
Vikahan voi myös olla käyttäjässä, esim oletus että samat conffit/skillit/claude.md ..jne toimii samanlailla mallista riippumatta voi johtaa että uudempi toimii huonommin. Ainakin omakohtaista kokemusta on

Uudempi > huonompi, olettaisin että epätodennäköistä, mutta hetkellisiä "tyhmentymiä" kyllä on.
 
Ainakin yksi osa-alue jossa on menty paljon eteenpäin uusimmilla malleilla on pelikehitys. Viime aikoina tullut seurattua ihmeissään tätä metodia käyttäviä "oneshot" pelejä ja niiden laatua (malllina Fable tai Opus 5): How to Run a Gauntlet Loop

Muutama esimerkki:

Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/mattshumer_/status/2082509137024274544


Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/rahilbhansali/status/2082440987411148955


Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/mattshumer_/status/2081054356405731740
 
gpt5.6 arc agi pisteitä saa merkittävästi ylöspäin asetuksia ronklaamalla. arc agi 3 tosi vaikea testi ai-koneille, yrittää mitata ihmismäistä kykyä ratkoa ongelmia joita ei ole voinut opetella etukäteen. Ehkä tästä yleistyy jotain vaikeampiin ohjelmistokehityksen tehtäviin.

On vielä semmoisia härpättimiä, että jos ei jaksa opetella+keksiä miten mallia paras käyttää niin kokemus voi olla ihan erilainen kuin sillä joka jaksaa.
Benchmarks rarely measure AI models in isolation. They also measure less visible choices about API settings, harness design, and prompting. In the case of ARC-AGI-3, we discovered that turning on two API settings we use in ChatGPT and Codex—retained reasoning and compaction—tripled scores and cut output tokens by 6x on the public task set.
1785410803454.png

First, we noticed that after each game action, all private reasoning was discarded. This meant that with each action, GPT‑5.6 Sol was asked to figure out the game anew, unable to remember its past thinking. The model could still see a record of past moves and brief accompanying notes, but it could not see the plans, insights, or thoughts that led to them.

Second, we saw that the harness used a rolling truncation window, causing older actions to become invisible as the history grew. So not only was GPT‑5.6 Sol unable to remember its past thinking, it was losing memory of its past actions too.
 
OpenAI pudotteli luna ja terra hintaa. Samalla kertoivat, että AI optimoi tuotantokoodia/kerneleitä. SOL hintaa ei tiputettu. Hinnanpudotus näkyy myös kuukausitilaukseen kuuluvien tokenien määrässä
Starting today, GPT‑5.6 Luna, our fastest and most affordable model, will cost 80% less, while GPT‑5.6 Terra, our balanced model for everyday work, will cost 20% less. These lower prices for Luna and Terra are also reflected in how usage is counted against paid subscriptions when using Codex and ChatGPT Work
GPT‑5.6 Sol is increasingly helping us find and deliver the next round of gains. Within a human-led process, Sol autonomously rewrote and optimized production kernels, designed and ran hundreds of experiments to improve token generation, and monitored training, intervening when problems arose. The kernel work helped reduce the end-to-end cost of serving the model by 20%, while its experiments increased token-generation efficiency by more than 15%. This work continues, creating a tighter feedback loop: as our models improve and are able to work more autonomously, our ability to improve efficiencies accelerates. Read more⁠ about the engineering behind GPT‑5.6.
 
Viimeksi muokattu:
OpenAI vetää oikein kunnolla mattoa pois Anthropicin alta.

Edit: uudet limiitit plus-tilauksille.
  • GPT-5.6 Sol: 15–90 → 10–100
  • GPT-5.6 Terra: 20–110 → 25–200
  • GPT-5.6 Luna: 50–280 → 250–2,000
Otin lomalle 20x tilauksen niin käytännössä rajatonta koodausta Lunalla.
 
Viimeksi muokattu:
Harness alkaa olla kohta tärkeämpi kuin kielimalli. Se kuitenkin määrittää miten tehokkaasti LLM toimii. Mutta varmaan vielä jonkin aikaa nähdään myös kielimalleissa isoja loikkia.
Nää menee niin nopeasti eteenpäin, että en ole pysynyt mukana.

Ensin opettelin OpenClaw + eri token maksuperusteisiä malleja.
Siirryin Claude Codeen ja ensimmäinen kk-maksu Max 20x menossa. Olen tehnyt viisi W11 sovellusta ja nettisivua Opus ja Fable malleilla.

Nyt YouTubessa hypetetään, että parasta on harness + token maksuperusteinen malli, onko se sitten uusin Cursor + Opus 5 / Fable 5 tai GPT 5.6?
Vai suositteletteko jotain muuta harnessia.

Mulla ei ole mitään käsitystä, että 200€ Max 20x versus harness + token Opus 5 / Fable 5, kummalla saa enemmän koodia per 200€?
Vai onko kyse siitä, että harness + malli yhdistelmällä se ei mieti joka välissä niin kauaa ja content window pysyy pienempänä?

Jos joku viitsisi avata asiaa, arvostan.
Kiitos etukäteen.
 
Nää menee niin nopeasti eteenpäin, että en ole pysynyt mukana.

Ensin opettelin OpenClaw + eri token maksuperusteisiä malleja.
Siirryin Claude Codeen ja ensimmäinen kk-maksu Max 20x menossa. Olen tehnyt viisi W11 sovellusta ja nettisivua Opus ja Fable malleilla.

Nyt YouTubessa hypetetään, että parasta on harness + token maksuperusteinen malli, onko se sitten uusin Cursor + Opus 5 / Fable 5 tai GPT 5.6?
Vai suositteletteko jotain muuta harnessia.

Mulla ei ole mitään käsitystä, että 200€ Max 20x versus harness + token Opus 5 / Fable 5, kummalla saa enemmän koodia per 200€?
Vai onko kyse siitä, että harness + malli yhdistelmällä se ei mieti joka välissä niin kauaa ja content window pysyy pienempänä?

Jos joku viitsisi avata asiaa, arvostan.
Kiitos etukäteen.
Mun arvaus on, että tokenimäärän ja hinta/laatu pohjalta openai codex 200e/kk tilaus olisi paras tällä hetkellä. Claudecode niin on melko tiukat rajoitteet paljonko fablea saa ja dumb mode pyörii turhan usein kuviossa. OpenAI:lla tuntuu konesalikapasiteettia riittävän paremmin kuin anthropic:lla. Paras malli vaihtelee senkin mukaan mitä tekee ja miten promptaa. Lienee fable tai gpt5.6 paras. Tilanteet muuttuu koko ajan. Enää ei tarvi parasta mallia parhailla parametreilla kaikkiin taskeihin.

Työkalut on niin samanlaisia, että ei ole iso vaiva vaihtaa yhdestä toiseen. Toki vaatii sen, että asiat on skriptattuna ja dokumentoituna sopivasti. Työkalua/mallia vaihtaessa uusi malli osaa napata dokumentaation pohjalta kiinni siitä miten asiat tehdään, esim. käännös tai debuggaus.

Cursor AI tais tipahtaa kauas kärjestä. Tosin niillä voi olla halvimmat tokenit jos se cursor ai:n composer malli riittää. En ole yli vuoteen cursor ai:ta käyttänyt.

Idea noissa kaikissa alkaa olemaan, että ihmisen koodirivejä nolla ja aika menee sen miettimiseen että miten saa AI:n tekemään laadukasta koodia itsekseen.
 
Codexilla on saanut koodata käytännössä rajattomasti koko kesän kun resettejä on tullut parin päivän välein. Varmaan se touhu toki jossain vaiheessa loppuu. Claudesta pidän enemmän mutta varsinkin 19.8. jälkeen se menee kalliiksi kun tilauksilta lähtee 50% usagesta pois.
 
Codexilla on saanut koodata käytännössä rajattomasti koko kesän kun resettejä on tullut parin päivän välein. Varmaan se touhu toki jossain vaiheessa loppuu. Claudesta pidän enemmän mutta varsinkin 19.8. jälkeen se menee kalliiksi kun tilauksilta lähtee 50% usagesta pois.
Oho, no pitää sit varmastikin vaihtaa.
Onko joku teistä koittanut laittaa saman scriptin Claude Code Opus 5 / Fable 5 ja Codex gpt 5.6, tuleeko molemmista yhtä laadukasta tavaraa ulos?
 
Katsoin alkupään viestejä ja kauaksi on tultu pelkistä koodausavustimista. Oma skeptisyys myös vähentynyt.

Oma koodaus on mennyt siihen että se jo vähän rönsyilee. Käytännön tarpeesta Amigalle saa nyt (kohta) myös C#-kääntäjän.


Aiemmin tuollainen olisi ollut elinikäinen projekti. Edelleenkään AI ei poista oman osaamisen ja kokemuksen tarvetta, mutta turha näppäimistön naputtelu jää pois.
 
Edelleenkään AI ei poista oman osaamisen ja kokemuksen tarvetta, mutta turha näppäimistön naputtelu jää pois.
Riippuu vähän mitä ollaan tekemässä. Omasta mielestä yhä harvemmassa asiassa tarvitaan kokemusta ja osaamista. Joissain varmasti vielä tarvitaan, mutta jos kehitys jatkuu, niin edelleen yhä harvemmassa asiassa tarvii.

Onhan määrittelykin jonkinlainen taito, mutta jo aika suppealla määrittelyllä voi rakennuttaa itselleen (tai miksei muillekin) ihan hyödyllisiä työkaluja moneen lähtöön.

Esim. jos ajatellaan jotain "perinteistä" liiketoimintataloa - siis ei softatalo - joka ostaa kaiken IT-kaman, mukaanlukien softat toimittajilta, niin ei talossa kukaan tiedä miten ne softat oikeasti toimii. Mikä muuttuu jos toimittaja vaihdetaan AI agentteihin?

Ehkä vastuu, mutta eiköhän nekin asiat hoideta jollain skannereilla ja/tai testeillä. "Tarvittavat testit oli tehty, ei olla vastuussa".
 
Käytättekö te mitään "skills" juttuja noissa agenteissa?
Riippuu vähän mitä teen. Joku perus line of business- softa ni en oikein käytä. Mut sit ku teen isompia projekteja, tai esim slaideja esityksiin, niin käytän. Slaidit sen takia, että saan tietyn tyylistä. Isommissa projekteissa taas joutuu alkaa pilkkomaan softaa osiin, ja skillit on hyvä tapa saada ondemand ohjeet tietylle domainille.
 
Käytättekö te mitään "skills" juttuja noissa agenteissa?
Itse miellän skillit vähän kuin funktioiksi, eli jos niiden käytössä on järkeä osana kokonaisuutta niin sitten. Jos agentilla pitää aina tehdä asiat X,Y,Z niin ei ole oikeastaan hyötyä että ne olisivat erillisiä skillejä.
 

Statistiikka

Viestiketjuista
312 675
Viestejä
5 312 252
Jäsenet
84 313
Uusin jäsen
einoantti

Hinta.fi

Back
Ylös Bottom