AI-koodausavustimet, keskustelua AI-avustetusta koodaamisesta/skriptaamisesta/dokumentoinnista/...

Tämä on hyvä, ja samalla tämä on huono.

Mitä enemmän ihminen osallistuu sitä suurempi on variaatio tavoilla lähestyä asioita. Mitä vähemmän ihminen osallistuu sitä homogeenisempia on lähestymiskulmat ja tavat ratkaista ongelmia. Ja koska agent AI on prosessi eikä vain kysymys-vastaus, se "standardoi" ongelmien ratkaisun ja metodin, ja lopulta ratkaisun.
C#-koodaajana minua huvittaa. Miksi käyttää mitään muita kuin standardiratkaisuja?
 
Tuossa kun testannut ja benchmarkannut niin GPT ajelee välillä aika railakkaasti PowerShell skriptejä. Windowsin SmartScreen takertuu välillä niihin ja nirhailee pois. Luulee niitä troijalaisiksi.

Nyt sitten kävi niin että IT:ssä joku laskuri täyttyi ja työläppäri meni lukkoon. Soitto IT-tukeen (missä ei puhuta suomea eikä englantiakaan kuin nimeksi)

IT: Joo täällä näkyy että sun tunnus on lukittu ja cs-tiimi tutkii. Eikö kukaan ottanut teamsissa yhteyttä?"

Minä: Mistä minä tietäisin kun läppäri on lukittu.

IT: Teams puhelimessasi?

Minä: Mulla mitään sellaisia ole puhelimessa.

IT: Miten sinuun sitten saa yhteyttä?

Minä: soittamalla tähän numeroon?

IT: Pitäisi olla teams...

Minä: Ei vaan ole. Mut hei, joku ottaa yhteyttä varmaan joskus. Kiitos.

IT: ilman teamsia voi olla vaikeaa...

Minä: kiitos ja näkemiin!

(Huomenna voi olla mielenkiintoinen päivä kun asiaa jahkataan....)
 
Tuossa kun testannut ja benchmarkannut niin GPT ajelee välillä aika railakkaasti PowerShell skriptejä. Windowsin SmartScreen takertuu välillä niihin ja nirhailee pois. Luulee niitä troijalaisiksi.

Nyt sitten kävi niin että IT:ssä joku laskuri täyttyi ja työläppäri meni lukkoon. Soitto IT-tukeen (missä ei puhuta suomea eikä englantiakaan kuin nimeksi)

IT: Joo täällä näkyy että sun tunnus on lukittu ja cs-tiimi tutkii. Eikö kukaan ottanut teamsissa yhteyttä?"

Minä: Mistä minä tietäisin kun läppäri on lukittu.

IT: Teams puhelimessasi?

Minä: Mulla mitään sellaisia ole puhelimessa.

IT: Miten sinuun sitten saa yhteyttä?

Minä: soittamalla tähän numeroon?

IT: Pitäisi olla teams...

Minä: Ei vaan ole. Mut hei, joku ottaa yhteyttä varmaan joskus. Kiitos.

IT: ilman teamsia voi olla vaikeaa...

Minä: kiitos ja näkemiin!

(Huomenna voi olla mielenkiintoinen päivä kun asiaa jahkataan....)

Kunnon dystopia :darra:
Ite hommasin virrman piikkiin ison ssd:n johon linux. Ajelen sillä tutkan alla vailla huolia ja windowsiin en oo buutannut kohta vuoteen
 
Minulla on julkinen Facebook ryhmä jonka selaus ei vaadi kirjautumista. Chatgpt, Gemini eikä Copilotkaan osaa katsoa vaikkapa ryhmän kokoa saatika keräämään siitä mitään statistiikkaa. Onko tämä normaali rajoitus johonka mikään tekoäly ei vielä kykene?
Kysyitkö siltä tekoälyltä, että miksi ei onnistu?:) Yleensä osaavat aika tarkkaan kertoa, että mikä blokkaa ja miksi.
 
Mulle tais Gemini joskus selttää, että saitit kuten Facebook blokkaa kaikki ei_selain kyselyt automaattisesti osana tietojen keräyksen estämistä.
 
C#-koodaajana minua huvittaa. Miksi käyttää mitään muita kuin standardiratkaisuja?
Piti tarttua näin aamusta tähän, sanoisin ennemmin, että joka ongelmaan on olemassa siihen parhaiten sopiva ratkaisu (ns per vaatimukset). Joskus se on standardiratkaisu, joskus ei.

Jos tässä tarkoitettiin standardi == paras niin tämä sitten no-op kommentti :)
 
Kokeilin tuota codexia vscodessa sekä vähän copilot chattia. Mutta ehkä en osannut mutta ei vakuuttanut. Copilot kai vaatii tilauksen.

Codexilla meni 10 minuuttia suht yksinkertaiseen muutokseen ja se teki paljon muutakin kuin piti.

Onko jotain rautalankaa miten ja milloin näitä kannattaa käyttää. Yksi hyvä on jos lisää kolmmenteja koodiin mitä tekee mutta siinäpä ainut hyvä käyttötarkoitus mitä minä löysin.
 
Kunnon dystopia :darra:
Ite hommasin virrman piikkiin ison ssd:n johon linux. Ajelen sillä tutkan alla vailla huolia ja windowsiin en oo buutannut kohta vuoteen

Kun on dystopia kyseessä, niin tuo ei varmasti tule käymään kenellekään. Mutta mitä tulee Codexiin, niin se ainakin osaa suoraan käyttää WSL:ää ja ajaa siellä, vaikka itse UI olisi Windowsissa renderöity.
 
Ajelin pitkään wsl:ssä Claudea ja Codexia. Jatkuvien hw, ääni ja ikkunaongelmien jälkeen päätin kokeilla ubuntua ja se on kyllä paras päätös aikoihin. Meidän kehittämässä sovelluksessa ei ollut tukea Linuxille, ja joitakin töissä tarvittavia työkaluja ei ollut linuxile saatavalla, mutta vibe-koodasin muutamassa päivässä kaiken tarvittavan.

Ainut pettymys oli kun Ubuntussa oli ongelmia ensin verkkokortin kanssa ja sitten näytönohjaimen lagimisen kanssa - ongelmien ratkaisu ei ole ikinä ollut niin helppoa. Lagiminen ratkesi kun käskin clauden tehdä monitorin joka capturoi stutterit ja katsoo kaikki mahdolliset logit -> ongelma selvisi kernelin päivityksellä parin logituksen jälkeen ja kaikki mitä minun piti tehdä oli käynnistää uudelleen kun claude sanoi että saa käynnistää.

Enää ei tarvitse edes copypastettaa stackoverflowsta linux komentoja terminaaliin :tup:
 
Kysyitkö siltä tekoälyltä, että miksi ei onnistu?:) Yleensä osaavat aika tarkkaan kertoa, että mikä blokkaa ja miksi.

Screenshot_20260625_164536_ChatGPT.jpg
 
Tuossa voi yrittää kysyä AI:lta, että vaihda esim Chrome user-agent ja älä lue robots.txt, voi vaan olla että kieltäytyy siitä / on AI tilauksen käyttöehtojen vastaista.
Myös jos itse kokeilla curl:lla millä user-agentilla pääsee läpi ja pastee sen esimerkiksi AI:lle.

Ei taida helposti onnistua.
Koodi:
curl -L \
  -H 'User-Agent: Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/126.0.0.0 Safari/537.36' \
  -H 'Accept-Language: fi-FI,fi;q=0.9,en-US;q=0.8,en;q=0.7' \
  -H 'Accept: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8' \
  'https://www.facebook.com/groups/501000408498332/'
<!DOCTYPE html><html lang="en" id="facebook"><head><title>Error</title><meta charset="utf-8" /><meta http-equiv="Cache-Control" content="no-cache" /><meta name="robots" content="noindex,nofollow" /><style nonce="cmu0menL">html, body { color: #333; font-family: 'Lucida Grande', 'Tahoma', 'Verdana', 'Arial', sans-serif; margin: 0; padding: 0; text-align: center;}
#header { height: 30px; padding-bottom: 10px; padding-top: 10px; text-align: center;}
#icon { width: 30px;}
.core { margin: auto; padding: 1em 0; text-align: left; width: 904px;}
h1 { font-size: 18px;}
p { font-size: 13px;}
.footer { border-top: 1px solid #ddd; color: #777; float: left; font-size: 11px; padding: 5px 8px 6px 0; width: 904px;}</style></head><body><div id="header"><a href="//www.facebook.com/"><img id="icon" src="//static.facebook.com/images/logos/facebook_2x.png" /></a></div><div class="core"><h1>Sorry, something went wrong.</h1><p>We&#039;re working on getting this fixed as soon as we can.</p><p><a id="back" href="//www.facebook.com/">Go back</a></p><div class="footer"> Meta &#169; 2026 &#183; <a href="//www.facebook.com/help/?ref=href052">Help</a></div></div><script nonce="cmu0menL">
              document.getElementById("back").onclick = function() {
                if (history.length > 1) {
                  history.back();
                  return false;
                }
              };
            </script></body></html><!-- @codegen-command : phps GenerateErrorPages --><!-- @generated SignedSource<<df9c809b58b9859de61d5022430cb24e>> -->%
 
Viimeksi muokattu:
Virallisesti gpt5.6:et julkaistu "limited preview". Herää kysymys miten paljon kourallinen firmoja saa ison edun jos ensimmäisenä heillä mallit käsissä ja muut saavat viikkoja/kuukausia myöhemmin mallit käyttöön. Ihan tyhmänä esimerkkinä mikä ei liene pidä paikkaansa mutta mielikuvaharjoituksena, mitä jos nvidia saa openai+anthropic käyttöön 1kk ennen amd:ta?

Hieno ajatus aurinko, maa, kuu visualisaatiolla kuvata mallien kokoa.

Aina ei hinnat pompsahda?
Terra has competitive performance to GPT‑5.5 while being 2x cheaper and Luna brings strong capability at our lowest cost
Millon me päästään kokeilemaan?
We believe in broad access, and we plan to make GPT‑5.6 Sol, Terra, and Luna generally available in the coming weeks.
Parhaimmasta mallista
With GPT‑5.6, we’re introducing a new `max` reasoning effort to give Sol the most time to reason deeply. Additionally, we’re introducing a new `ultra` mode that goes beyond the capabilities of a single agent by leveraging subagents to accelerate complex work

1782494867696.png

 
Viimeksi muokattu:
Hieno ajatus aurinko, maa, kuu visualisaatiolla kuvata mallien kokoa.

Aina ei hinnat pompsahda?

Ihan kilpailukykyiset mun mielestä noi hinnat 🤔
Lähelle 5.5, 5.4, 5.4-mini API-hinnoilta (paitsi että Luna on kalliimpi kuin 5.4-mini)

GPT‑5.6 is priced per 1M tokens across three model sizes:
Sol is $5 input / $30 output;
Terra is $2.50 input / $15 output;
and Luna is $1 input / $6 output.
 
Ihan kilpailukykyiset mun mielestä noi hinnat 🤔
Lähelle 5.5, 5.4, 5.4-mini API-hinnoilta (paitsi että Luna on kalliimpi kuin 5.4-mini)
Hyvältähän nuo hinnat vaikuttaa jos/kun saa 5.5 tasoisen puolella hinnasta ja sol tulee päälle kalliimmalla jos tarvii paremman mallin. Oli pienellä printillä blogissa juttua, että jos on paksu pinkka niin saa extranopean version sol:sta käyttöön cerebrasin raudalla. Aika on rahaa porukalle cerebrasia :) Nvidialta tulossa vera-rubin + groq lpu systeemi loppuvuodesta aika on rahaa porukalle myös. OpenAI:sta ollut huhua, että miettivät myös extra slow palvelua millä täytettäisiin kuplat konesalissa. Saisi halpoja tokeneita jos on valmis odottamaan. Vois olla ihan ok. harrasteprojekteihin extra slow ja antaa agentin jauhaa samalla kun itse tekee jotain muuta.

Yritin viitata hintaheitolla siihen, että edelleen näyttää löytyvän keinoja tarjota samaa suorituskykyä halvemmalla samalla kun tulee parempaa suorituskykyä tarjolle kalliimmalla.

We're also launching GPT‑5.6 Sol on Cerebras at up to 750 tokens per second in July, bringing frontier intelligence to customers at unprecedented speed. Access will initially be limited to select customers as we expand capacity.
 
Virallisesti gpt5.6:et julkaistu "limited preview". Herää kysymys miten paljon kourallinen firmoja saa ison edun jos ensimmäisenä heillä mallit käsissä ja muut saavat viikkoja/kuukausia myöhemmin mallit käyttöön. Ihan tyhmänä esimerkkinä mikä ei liene pidä paikkaansa mutta mielikuvaharjoituksena, mitä jos nvidia saa openai+anthropic käyttöön 1kk ennen amd:ta?
Iso etu sekin jos on amerikkalainen firma ja amerikkalaiset työntekijät... Ainakin siihen asti kun kiinalaiset kurovat eron kiinni.
 
Iso etu sekin jos on amerikkalainen firma ja amerikkalaiset työntekijät... Ainakin siihen asti kun kiinalaiset kurovat eron kiinni.
En usko, että kiinalaiset kurovat eroa kiinni. Puuttuu laskentatehoa. Isoilta osin yrittävät kopioida distilloinnin avulla ja huijataan benchmarkeissa. Esim. deepseek v4 pro benchmarkeissa paljon parempi kuin oikeassa käytössä. Tähän päälle se, että openai ja anthropic sisäisesti 6kk edellä sitä mitä me saadaan pilvestä ostettua. Jos pyörä pyörii niin että AI:sta on apua AI:n kehittämisessä niin 6kk sisäistä etua on valtava juttu jossain kohtaa. Tän takiahan nyt on ihan järjetön satsaus kaikkien taholta kun on pelkotila, että tipahtaa pysyvästi kelkasta jos ei laita 100-200miljardia/vuosi konesaleihin ja hommaa parhaita aivoja satojen miljoonien kompensaatiopaketeilla. Arvelen, että sisäisesti frontier pajoilla paremmat parametrit ja vähemmän turvakaiteita malleissa versus se mitä 3rdparty saa pilvestä ostettua. Helpottaa tekemistä kun ei tule claude idiot moodia vastaan ja tokenit omakustannehinnalla versus hinnassa mukana myyjän voittomarginaali.
Anthropic said the campaign was conducted between April 22 and June 5, 2026, and generated more than 28.8 million exchanges with Claude through almost 25,000 fraudulent accounts.
The strike by Alibaba is described as a "distillation" effort, which Anthropic has said involves training a less capable model on the outputs of a stronger one
 
Viimeksi muokattu:
En usko, että kiinalaiset kurovat eroa kiinni. Puuttuu laskentatehoa. Isoilta osin yrittävät kopioida distilloinnin avulla ja huijataan benchmarkeissa. Esim. deepseek v4 pro benchmarkeissa paljon parempi kuin oikeassa käytössä.

Kuinka kauan on puute laskentatehosta? Täytyy muistaa, että kiinalaiset voivat vaikka kaikki käydä yhden ainoan mallin päälle ja käyttää kaiken maassa olevan laskentatehon jos näin päättävät. Tai käyttää vanhempiakin piirejä ja rakentaa huvin vuoksi yhden ydinvoimalan siihen viereen ilman pitkiä lupaprosesseja. Huawei voidaan valjastaa vaikka mihin.

Millä perusteella Deepseek on heikompi todellisuudessa kuin benchmarkeissa? Sinulle on jo monesti näytetty ettei se DeepSWE ole mistään kotoisin ja sen sorsakooditkin on nähtävillä vaikka et sitä tahtonut uskoa. Onko tämä taas vain perinteinen "tykkään tuosta enemmän" ?

Anthropic toki itkee että muut pöllii, mutta samalla tekee vastaavaa muille. Ei siitä kauaa ole kun Opus vastaili olevansa Deepseek.
 
Kuinka kauan on puute laskentatehosta?
Niin kauan kuin on sanktioita etteivät pääse käsiksi uusimpaan asml/tsmc. Piirien määrällä ei voi määräänsä enempää kompensoida kun piirienvälinen ja räkkienvälinen kommunikaatio muodostuu pullonkaulaksi. Tän takia nvidian nvl72 räkkikonfiguraatio ja googlen tpu:t vie opetushommissa ja muut vikisee. AMD helios nousee kisaan mukaan loppuvuodesta.

Jos nyt suurennuslasilla niin kiinalaiset mainospuheista huolimatta opettavat nvidialla mallejansa ja distilloivat länkkäreiden malleista. Edellisen postauksen tapaus alibaba/qwen ja esim. tämä tapaus missä käytiin malesialaisessa konesalissa:
Chinese AI outfits smuggling suitcases full of hard drives to evade U.S. chip restrictions — training AI models in Malaysia using rented servers
https://www.tomshardware.com/tech-i...ng-ai-models-in-malaysia-using-rented-servers
 
Viimeksi muokattu:
Niin kauan kuin on sanktioita etteivät pääse käsiksi uusimpaan asml/tsmc. Piirien määrällä ei voi määräänsä enempää kompensoida kun piirienvälinen ja räkkienvälinen kommunikaatio muodostuu pullonkaulaksi. Tän takia nvidian nvl72 konfiguraatiot ja googlen tpu:t vie opetushommissa ja muut vikisee. AMD helios nousee kisaan mukaan loppuvuodesta.

Jos nyt suurennuslasilla niin kiinalaiset mainospuheista huolimatta opettavat nvidialla mallejansa ja distilloivat länkkäreiden malleista. Edellisen postauksen tapaus alibaba/qwen ja esim. tämä tapaus missä käytiin malesialaisessa konesalissa:

https://www.tomshardware.com/tech-i...ng-ai-models-in-malaysia-using-rented-servers
Ei liity suoraan AI, mutta ei Kiina tarvitse asml tsmc pärjätäkseen, juurihan he tekivät maailman nopeimman supertietokoneen. On aika hullua ajatella että kiina ei kehittäisi asioita, kun ne kuitenkin lopuksi menee amerikan ohi. Oli periaatteessa hyvä juttu että Kiinalle tuli estoja länsimaiseen teknologiaan, eli ne joutuu kehittämään itse oikeaa kilpailua maailmaan. Eikä kaikki nojaudu amerikkaan, onneksi.
 
Ei liity suoraan AI, mutta ei Kiina tarvitse asml tsmc pärjätäkseen, juurihan he tekivät maailman nopeimman supertietokoneen. On aika hullua ajatella että kiina ei kehittäisi asioita,
Tuo on cpu pohjainen järjestelmä joka on ihan naurettavan hidas ja pieni jos yrität käyttää neuroverkkojen opettamiseen. Toinen pointti on, että nuo openai/anthropic/google/microsoft/amazon/... konesalit eivät ole superkonelistalla kun heitä ei listat kiinnosta.

Tuo shineline siis 2.2-2.7 exafloppia. Yksi nvidian gb300 räkki missä 72gpu:ta on 1.1-1.4exafloppia. 2 tai 2.5 nvidian räkkiä eli sellainen alle 200gpu:ta on nopeampi opettamaan ja ajamaan neuroverkkoja kuin toi koko kiinalainen härveli. Jos nyt kokoluokkaa niin spacex:lla esimerkiksi on 800000 nvidian gpu:ta konesaleissa yhteensä ja noita uusimpia isoja malleja opetetaan 100000-200000gpu:ta klusterilla. Nvidian seuraavassa(vera-rubin / vera rubin ultra 2h2026, tai 2h2027) verkko skaalaa siihen, että saataneen noin miljoona gpu:ta yhtä mallia opettamaan niin ettei tehokkuus kärsi.

Toinen tapa ajatella on, että tuo kiinalainen shineline on 42MW. Openai&co puhuvat gigawateista ja kymmenistä gigawateista konesalien koossa mitä rakennetaan. 1GW ai konesali maksaa pyöreästi 50miljardia rakentaa. Jenkkifirmat laittavat tänä vuonna noin 700miljardia ja ensi vuonna biljoonan ai-konesaleihin. Tuosta voi yrittää laskea gigawatteja ja gpu-määriä.
---
Kuvan vera-rubin nvl4 systeemissä olis 14.4/28exafloppia(riippuen miten laskee). Virtaa ottaa jotain 3MW. Tämä on massatuotannossa ja pian myös tarjolla konesaleissa. Virallisesti q3:lla alkaa lopullisen tuotteen toimitukset, mutta kuvia sampleista eri konesaleissa on jo näkynyt.
1782508517229.png

 
Viimeksi muokattu:
Tuo on cpu pohjainen järjestelmä joka on ihan naurettavan hidas ja pieni jos yrität käyttää neuroverkkojen opettamiseen. Toinen pointti on, että nuo openai/anthropic/google/microsoft/amazon/... konesalit eivät ole superkonelistalla kun heitä ei listat kiinnosta.

Tuo shineline siis 2.2-2.7 exafloppia. Yksi nvidian gb300 räkki missä 72gpu:ta on 1.1-1.4exafloppia. 2 tai 2.5 nvidian räkkiä eli sellainen alle 200gpu:ta on nopeampi opettamaan ja ajamaan neuroverkkoja kuin toi koko kiinalainen härveli. Jos nyt kokoluokkaa niin spacex:lla esimerkiksi on 800000 nvidian gpu:ta konesaleissa yhteensä ja noita uusimpia isoja malleja opetetaan 100000-200000gpu:ta klusterilla. Nvidian seuraavassa(vera-rubin / vera rubin ultra 2h2026, tai 2h2027) verkko skaalaa siihen, että saataneen noin miljoona gpu:ta yhtä mallia opettamaan niin ettei tehokkuus kärsi.

Toinen tapa ajatella on, että tuo kiinalainen shineline on 42MW. Openai&co puhuvat gigawateista ja kymmenistä gigawateista konesalien koossa mitä rakennetaan. 1GW ai konesali maksaa pyöreästi 50miljardia rakentaa. Jenkkifirmat laittavat tänä vuonna noin 700miljardia ja ensi vuonna biljoonan ai-konesaleihin. Tuosta voi yrittää laskea gigawatteja ja gpu-määriä.
Ei listat kiinnosta? siihen en usko. Eli sinun mukaan ne pääsisi heittämällä ykköseksi, sen jälken top listat olisi vessapaperia. Tosiaan puhutaan vähän eri asioista, mutta pointti tuli selväksi, Kiina tulee pärjäämään ilman perinteistä vanhanaikaista ajattelutapaa.
 
Ei listat kiinnosta? siihen en usko. Eli sinun mukaan ne pääsisi heittämällä ykköseksi, sen jälken top listat olisi vessapaperia. Tosiaan puhutaan vähän eri asioista, mutta pointti tuli selväksi, Kiina tulee pärjäämään ilman perinteistä vanhanaikaista ajattelutapaa.
No ei tämä ole uskon asia. Numerot ei valehtele. Tarvit sen 2-2.5 räkkiä (gb300 nvl72 NVIDIA GB300 NVL72 ) samaan exafloppimäärään tän hetkistä gb300:sta kuin sun linkkaama kiinakone. Tai nyt tuotannossa olevaa vera-rubin nvl4:ssa 3-4x enempi flopseja. Linkistä laitat tilaukseen vera-rubin nvl4. Syö sähköäkin alle 1/10:an kiinaihmeestä. Ei kukaan tervejärkinen yritä llm:ia opettaa cpu:lla. CPU järjestelmässä vois olla melko haastava saada flopsit ulos llm:aa opettaessa kun on niin monta corea joiden välillä tarvii kommunikoida versus kourallinen ai-kiihdyttimiä.
1782509156677.png


spacex:lla on colossus2:ssa 550000 gb200/gb300 gpu:ta. Tuohon päälle colossus1 ja uusia rakenteilla mihin menee ensimmäiset nvidian vera-rubinit pian. Näitä kannattaa googlettaa jos kiinnostaa. Jätän tässä ketjussa asian puimisen tähän kun ollaan jo aika kaukana koodiavustimista
 
Viimeksi muokattu:
No ei tämä ole uskon asia. Numerot ei valehtele. Tarvit sen 2-2.5 räkkiä (gb300 nvl72 NVIDIA GB300 NVL72 ) samaan exafloppimäärään tän hetkistä gb300:sta kuin sun linkkaama kiinakone. Tai nyt tuotannossa olevaa vera-rubin nvl4:en 3-4x enempi flopseja. Linkistä laitat tilaukseen vera-rubin nvl4. Syö sähköäkin alle 1/10:an kiinaihmeestä. Ei kukaan tervejärkinen yritä llm:ia opettaa cpu:lla. CPU järjestelmässä vois olla melko haastava saada flopsit ulos llm:aa opettaessa kun on niin monta corea joiden välillä tarvii kommunikoida versus kourallinen ai-kiihdyttimiä.
1782509156677.png

Listat ei kiinnosta niitä kun ne ei pärjää samalla vertailulla (eli perinteisellä prossulaskennalla). En löytänyt tuosta uutisesta muutes Flopseja.
Toki viimeaikaiset kommenttini ovat jonkin verra offtopic, eli perus prossulaskenta ja ai laskenta on kuitenkin niin paljon eri asia. Flopsit ei suoraan vertaannu, eli numerot "valehtelee" tässä tilanteessa, kun verrataan eri asioita.
 
Listat ei kiinnosta niitä kun ne ei pärjää samalla vertailulla (eli perinteisellä prossulaskennalla). En löytänyt tuosta uutisesta muutes Flopseja.
Toki viimeaikaiset kommenttini ovat jonkin verra offtopic, eli perus prossulaskenta ja ai laskenta on kuitenkin niin paljon eri asia. Flopsit ei suoraan vertaannu, eli numerot "valehtelee" tässä tilanteessa, kun verrataan eri asioita.
Nyt ollaan koodiavustimet ketjussa ja kyse oli pieni offtopic kielimallien opettamiseen. Kielimallien opettamisessa cpu:t eivät pärjää. Ts. se sun linkkaama cpu-kiinasysteemi ei ole millään tavalla relevantti. Oli varmaan aika turhaa tuoda mitään cpu klusteria keskusteluun mukaan. Jos käyt googlessa niin löydät, että kiinan omat parhaat ai-kiihdyttimet vertautuvat ehkä jollain tavalla kilpailukykyisesti yksittäiseen 2022 julkaistuun h100 piiriin. Siitä on pitkä matka uusimpaan vera-rubiniin, uusimpaan hbm-muistiin, uusimpiin räkkeihin, uusimpiin verkkoratkaisuihin, stabiiliin isoon konesaliin jossa mallin opettaminen onnistuu(piirejä kuolee,...) jne.

Jos nyt alleviivaten niin tämä on se taso missä frontierissa mennään
1782510632548.png
 
Viimeksi muokattu:
En usko, että kiinalaiset kurovat eroa kiinni. Puuttuu laskentatehoa. Isoilta osin yrittävät kopioida distilloinnin avulla ja huijataan benchmarkeissa. Esim. deepseek v4 pro benchmarkeissa paljon parempi kuin oikeassa käytössä. Tähän päälle se, että openai ja anthropic sisäisesti 6kk edellä sitä mitä me saadaan pilvestä ostettua. Jos pyörä pyörii niin että AI:sta on apua AI:n kehittämisessä niin 6kk sisäistä etua on valtava juttu jossain kohtaa. Tän takiahan nyt on ihan järjetön satsaus kaikkien taholta kun on pelkotila, että tipahtaa pysyvästi kelkasta jos ei laita 100-200miljardia/vuosi konesaleihin ja hommaa parhaita aivoja satojen miljoonien kompensaatiopaketeilla. Arvelen, että sisäisesti frontier pajoilla paremmat parametrit ja vähemmän turvakaiteita malleissa versus se mitä 3rdparty saa pilvestä ostettua. Helpottaa tekemistä kun ei tule claude idiot moodia vastaan ja tokenit omakustannehinnalla versus hinnassa mukana myyjän voittomarginaali.


"This also means Chinese models are almost certainly going to be restricted in some way - possibly even banned - in the West. Right now they're roughly nine months behind. If every American frontier release is forced into a slow, staggered rollout from now on, they'll start closing that gap immediately. Over time, this destroys Western labs business models, because users will eventually have access to genuinely equivalent open-source alternatives - and in time, even better ones! The US government will not allow that to happen. The only way to prevent it is if China agrees to the same staggered release schedule (unlikely but I suppose it's possible), keeping the gap roughly where it is today. Otherwise, the US will likely restrict or ban Chinese models. There's probably a nine-month window, at most, probably a lot less, before one of those outcomes plays out."
Linkki: https://x.com/AndrewCurran_/status/2070260156387226001


Vähän menee offtopiciksi nyt, mutta.... iso suositus Andrewn seuraamiselle. Ajanhermolla jatkuvasti ja tulee todella nopeasti tärkeimmät tekoälyyn liittyvät uutisoinnit ja hyviä omia näkemyksiä. Käsittääkseni kaikenlaisten tekoälyyn liittyvien veikkausten suhteen osunut kokoajan aika oikeaan. Mutta tärkein pointti varmaankin tuossa, että ainakin kuluttajapuolen bisnesmallille aikamoinen uhka, jos aletaan julkaista niin hitaasti uusia malleja kuluttajille ja että open-source ajaa rinnalle. Nytkin GLM-5.2 aika hyviä tuloksia vetänyt joissain benchmarkeissa:

HLb_-IvbgAAwCg_.jpg



Ja mitä tulee distillaatioon tässä ihan mielenkiintoinen näkemys:

firefox_lvugqqdwGg.png


Kyllä se Kiinakin pääsee Mythos-tason malliin käsiksi. Ei se "resepti" sen tason malliin ole mikään salaisuus enää. Hyvä asia kuitenkin imo. Ei oikein isompia spekulaatioita tee mieli edes heittää, kun 6 kk sisällä ollaan varmasti taas ihan uudella tasolla kaiken suhteen. Toivottavasti Kiina kuitenkin pystyy laittamaan hanttiin tekoäly kilpajuoksussa Amerikkaa vastaan. Seniilipappa-EU taitaa lähinnä haaveilla internet-sensuurista ja antaa muiden kehittää ihmiskunnan tärkeimmät ja mullistavimmat keksinnöt meidän elinaikana...
 
Pikkuhiljaa etenee fablen saaminen takaisin käyttöön. "trusted partners" saa käyttää nyt fable5, millon lie taviksille
“Anthropic has worked with the US government to address risks associated with the Covered Models,” Commerce Secretary Howard Lutnick wrote to the company’s chief compute officer in a letter seen by Bloomberg News. “These efforts have yielded significant progress,” he wrote, saying that the model could be released to “certain trusted partners.”
“We received notice from the US government that Mythos 5, our strongest cybersecurity model, can be redeployed to a small group of cyber defenders and infrastructure providers,” Anthropic said in a statement. “We are working to provision the approved set of providers and restore their access to Mythos 5 as quickly as possible. We are pleased to see this progress and continue to work with the government to expand access to Mythos 5 and make Fable 5 available for general use again.”
US officials told Anthropic that the restrictions would be lifted once the government’s security concerns have been addressed, said the people, who spoke on condition of anonymity because the discussions weren’t public.
 
Minä tuota GLM-5.2:sta ajatellut ottaa käyttöön z.ai-tilauksella, mutta ei vakuuta.
Kalliimpi ja huonompi kuin GPT-5.5 medium.
Ainakin omien kokemuksien mukaan DeepSWE benchmark on hyvin paikkaansa pitävä. Vanhat benchmarkit taitaa olla malleille koulutettuja, niin ne näyttää paremmalta mitä ovat.
1782560421632.png
 
Minä tuota GLM-5.2:sta ajatellut ottaa käyttöön z.ai-tilauksella, mutta ei vakuuta.
Kalliimpi ja huonompi kuin GPT-5.5 medium.
glm-5.2:ssa mua kiehtoo, että se on sangen pieni, 744miljardia parametria. Kaikkinensa kvm-cachen yms. kanssa lähellä kokoa missä mallin saisi järkevästi tungettua yhteen gb300 työpöytäserveriin kun käytetään cpu:ssa oleva erittäin nopea muisti ja cpu-gpu väylä järkevällä tavalla hyödyksi ja pakotetaan nvfp4 optimoinnit päälle. Jos tuon kokoluokan mallit nousevat kyvykkääksi niin alkaa kalliilla lokaaliraudalla olemaan mahdollista ajaa ainakin osa koodauskuormasta. Toki jos on tiimi käyttämässä ja rinnakkaisia pyyntöjä niin muisti loppuu, ihan siinä rajoilla toimiiko täydellä suorituskyvyllä yhdelle devaajalle/taskille kerrallaan kalliilla raudalla.
 
Viimeksi muokattu:
Vaikka oli huonoja kokemuksia tuosta copilot autocompletesta niin kokeilin vielä kerran ja kyllä se välillä on ihan hyvä ja säästää aikaa varsinkin kun muokaa vaikka data rakenetta ja sitten pitää koodia muokata uuteen uskoon. Tai debug.logii laittaa usein tärkeät muuttuja ja nimet niille. Käyttökokemus voisi olla vähän parempi kuten vaikka pienemmät segmentit ja parempi toimivuus normaalin intellisensen kanssa ettei tarvii aina painaa ctrl space että saa sen esiin
 
Toivottavasti Kiina kuitenkin pystyy laittamaan hanttiin tekoäly kilpajuoksussa Amerikkaa vastaan. Seniilipappa-EU taitaa lähinnä haaveilla internet-sensuurista ja antaa muiden kehittää ihmiskunnan tärkeimmät ja mullistavimmat keksinnöt meidän elinaikana...

Sinulla on tuossa vähän ristiriitaisia ajatuksia. Kiina on internet sensuurin suurvalta, sensuuri ei estä minkään kehittämistä.
 
Sinulla on tuossa vähän ristiriitaisia ajatuksia. Kiina on internet sensuurin suurvalta, sensuuri ei estä minkään kehittämistä.
En mielestäni ihan tuollaista tarkoittanut. Pointti oli, että siis EU ei ole minkäänlainen varteenotettava kilpailija nykyisessä kilpajuoksussa kohti AGIa vaan EU on keskittynyt lähinnä kaikenlaiseen muuhun turhuuten kuten edistämään vaikkapa kontrollia internetistä ja sananvapaudesta. Sensuurilla ja kehitys ei nyt liittynyt toisiinsa muutoin kuin, että EU:n prioriteetit ovat naurettavia lähinnä. Mutta tämä siis johtaa siihen, että EU on riippuvainen Amerikan laskentatehosta ja täten tuleva kehitysmaa. Amerikkalaiset pistää frontier malleilla sen neljännen teollisen vallankumouksen käyntiin ja Eurooppa joutuu taipumaan mihin tahansa Amerikka pyytää, jotta saadaan edes jonkinlaista käyttömahdollisuutta heidän malleihin ja laskentaan. Kiinan potentiaaliset avoimet mallit voivat disruptoida tätä kehityskulkua minkä takia itse toivon, että Kiina menestyy ja kirittää Amerikkaa.

Lainaa ja jatka tekoäly topikissa, jos haluat jatkaa :)


P.S.

Deepseek V4 tulossa heinäkuussa.

Tämän sisällön näkemiseksi tarvitsemme suostumuksesi kolmannen osapuolen evästeiden hyväksymiseen.
Lisätietoja löydät evästesivultamme.

Linkki: https://x.com/teortaxesTex/status/2071537369631625608
 
EU:n ja USA:n ero on siinä, että EU:ssa välitetään kansalaisista ja heidän oikeuksistaan.
 
EU suojaa kansalaisten tietoja ihan eri malliin kuin jenkit. Kuluttajansuojakin on ihan eri luokkaa, esimerkiksi mitä tahansa paskaa ei saa myydä ruokana.
 
Anthropic:lta sonnet5:en julkaistu. Ei mikään sukat lähtee jalasta julkaisu blogin pohjalta, mutta jos oli tarvetta halvemmalle niin tämähän se varmaan on.
Sonnet 5 narrows the gap: its performance is close to that of Opus 4.8, but at lower prices. It’s a substantial improvement over its predecessor, Sonnet 4.6, on important aspects of agentic performance like reasoning, tool use, coding, and knowledge work
Claude Sonnet 5 is available everywhere today at an introductory price of $2 per million input tokens and $10 per million output tokens through August 31, 2026. It then moves to standard pricing at $3 per million input tokens and $15 per million output tokens.2 We’ve increased rate limits across Chat, Cowork, Claude Code, and the Claude Platform3 to accommodate the higher token usage of higher effort levels; users can select whichever level makes sense for their particular project.
1782843047447.png

 
4.6 Sonnettia paljon tullut käytettyä, mutta kokonaiskulutuksesta (ns rahallisesti) se on ollut pieni osa. Tällä se tippuu vieläkin pienemmäksi, mutta summarum eipä se oikein missään sitten näy.

Joku Sonnet 4.6 temu edition olisi parempi nimi uuden version sijaan.
 
4.6 Sonnettia paljon tullut käytettyä, mutta kokonaiskulutuksesta (ns rahallisesti) se on ollut pieni osa. Tällä se tippuu vieläkin pienemmäksi, mutta summarum eipä se oikein missään sitten näy.

Joku Sonnet 4.6 temu edition olisi parempi nimi uuden version sijaan.
Tähän se tuntuu menevän, kun parempia malleja ei saa laittaa tarjolle. Tosin hyvähän tuo on, että hinta aspektinkin optimoivia malleja tulee.

Fable5/gpt5.6:sta odotellessa. Mitä lie noilla firmoilla labroissa nyt työn alla kun mythoskin tais anthropic:lla sisäisesti olla ihan alkuvuodesta lähtien käytössä. Ollaan ehkä 6kk ja pian sääntelyn takia 6kk+++ perässä julkisessa versus mitä frontier pajoilla sisäisesti käyttössä.
13b64be9c36adc85a0ba0ff31bd3ae52.jpg
 
Saako näillä malleilla mitenkään järkevää ulkoasua ilman, että design on valmiina mallille? Iski laiskuus ja yritin promptailla redesignin, tulokset oli ihan järkyttäviä joka mallilla, jonkun 15 yrityksen jälkeen sain suunnilleen siedettäväksi. Vähän yllätti miten surkeasti nuo suoriutuu, kun perus käyttämäni "generoi kuva, jossa UI tälle softalle" ja "tee UI kuvan näköiseksi" tekee huippulaatua.
 
Saako näillä malleilla mitenkään järkevää ulkoasua ilman, että design on valmiina mallille? Iski laiskuus ja yritin promptailla redesignin, tulokset oli ihan järkyttäviä joka mallilla, jonkun 15 yrityksen jälkeen sain suunnilleen siedettäväksi. Vähän yllätti miten surkeasti nuo suoriutuu, kun perus käyttämäni "generoi kuva, jossa UI tälle softalle" ja "tee UI kuvan näköiseksi" tekee huippulaatua.
Jaa-a, gpt5.6:ssa pitäisi olla frontendin erityisesti fokuksessa, mutta ei ole kukaan päässyt kokeilemaan. 5.5:en kyvyt tehdä nättiä käyttöliittymää 404.
 
"In the near term, some routine tasks like coding and debugging will fall back to Opus 4.8."
Eli maksa Fable 5 ja saa Opus 4.8 koodaus osaamista o_O
Taitaa kumminkin olla sitten vaan Opus 4.8 hinnoittelu.

Mutta joo alkaa kyllä Anthropic meno olemaan surkuhupaisaa, aloitat promptin Fable 5 Max effort ja 15min jälkeen käytössä Haiku 4.5 none effortilla.

Toivottavasti OpenAI ei lähde samaan sekoiluun.
 
Blogista lukee niin edelleen fable5 siirtymässä vain api/krediittihinnalla käytettäväksi
Fable 5 will be included for up to 50% of weekly usage limits through July 7, after which it will be available via usage credits.

kuinka vaarallinen se mython oikeasti oli,.. Noh,...
Our testing confirmed that many less capable models—including Claude Opus 4.8, GPT-5.5, and Kimi K2.7—could identify the same vulnerabilities as Fable 5 did in the report. When it came to the demonstration of how to exploit the single vulnerability, every model we tested could produce the same demonstration as Fable 5 (including Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8, GPT-5.4, GPT-5.5, and Kimi K2.7).
 
Voiko joku kertoa miten käytätte näitä ai juttuja ja mahdollisia subeja?

Onko cline ja opencode go hyvä vai kannattako käyttää jotai muuta?
 
Voiko joku kertoa miten käytätte näitä ai juttuja ja mahdollisia subeja?

Onko cline ja opencode go hyvä vai kannattako käyttää jotai muuta?
Anthropicin ja openai:n virallisia lokaalisti asennettuja appseja käyttänyt. Molemmat noista hyviä. OpenCodea testannut lokaalin kielimallin kanssa, surkea oli versus anthropic ja openai niin käyttöliittymän kuin toimivuuden puolesta. IDEä ei ole tarvinut pitkään aikaan availla. Terminaali ei enää oikein ole järkevä minulle kun puuhatessa useita projekteja ja rinnakkaisia taskeja, helpompi hanskata appsin kuin terminaalin kautta.
 

Statistiikka

Viestiketjuista
312 970
Viestejä
5 315 519
Jäsenet
84 389
Uusin jäsen
RetKiKimppa

Hinta.fi

Back
Ylös Bottom