Paikallisesti pyörivät LLM koodausavustimet

  • Keskustelun aloittaja Keskustelun aloittaja xanaki
  • Aloitettu Aloitettu
Pikatestasin laguna-s-2.1:q4_K_M 1adabf138c90 96 GB macbook pro m4 max 128GB promptilla " write a webpage using three.js for showing images" ihan ok näköinen lopputulos. Ei edes kamalan hidas. Pitäs pool:in haarniska asentaa ja testailla enemmän. En osaa arvailla esim. oliko nuo ollaman vakioparametrit fiksut ja mitä pool:in oma haarniska tekee esimerkiksi kontekstin luonnille ja järkeilyn määrälle.
1785429004722.png
 
Kaksikanavainen DDR5 yhä, rajoittanee menoa kyllä Nova Lakella. Muistikaista taitaisi jäädä karkeasti arvioiden noin puoleen Strix Halosta.
Näinhän se on. Mutta täytyy hyödyntää niitä mitä on. Jos ostaa Halon integroiduilla nopeilla muistella hinta tuplaantuu ja investointi ei ole enää kannattava eikä järkevä.
 
Näinhän se on. Mutta täytyy hyödyntää niitä mitä on. Jos ostaa Halon integroiduilla nopeilla muistella hinta tuplaantuu ja investointi ei ole enää kannattava eikä järkevä.
Missasin jotenkin että sulla oli tosiaan paljon muistia jo entisestään.

---

Mira Muratin (ex-OpenAI) Thinking Machinesilta julkaistiin juuri Inkling-Small joka on kooltaan erittäin lähellä DS4 Flashiä, 276B ja 12B aktiivisena tokenia kohden. Pistelin pikaisesti IQ3_S GGUF:n testiin ja 11-12t/s pyörittääpi, tosin toi llama.cpp tuki vähän työn alla vissiin vielä.

 
Viimeksi muokattu:
Asensin poolsiden haarniskan ja testailen laguna-s-2.1:q4_K_M. Oli ihan helppo saada toimimaan, tuntuu samalta kuin claudecode vajaa vuosi sitten. Kone puhisee kuin viimeistä päivää ja jossain määrin hitaasti etenee. Kyllä tuolla kuitenkin saa aikaiseksi jos ei halua pilvestä maksaa.

haarniska: GitHub - poolsideai/pool: pool is Poolside’s coding agent that runs in your terminal or integrates with any ACP-compatible editor

1785446238356.png



Tiukille menee, mutta muisti riittää. Ollappa nvfp4:sta tukevaa rautaa isolla muistilla. 5090 ei riitä tän kanssa.
1785446488613.png
 
Viimeksi muokattu:
Ei tullut valmista webbisivusta poolside+laguna-s-2.1:q4_K_M. kompasteli pikku-asioihin niin kuvien katsominen vr-kypärässä ei alkanut toimimaan. Vaikka token/s eval-rate 47token/s niin on niin hidasta iteroida että ennemmin ranteet vedän auki kuin jatkan tuolla iteroimista. Time to first token karkaa avaruuteen kun projektissa on vähänkään enempi koodia. En usko että 5090:enkaan nopeudella jaksaisi tuota käyttää kuin pikkuskriptien tekemiseen missä odotusajat inhimilliset.

Sinällään kyllä hyvä parannus vanhaan lokaaliin mitä saanut ajoon. Hyvinkin samassa tasossa missä pilvi oli vuosi sitten. Vaatii paljon käsin tunkkaamista ja odottelua jos mitään haastavampaa yrittää. Suurin itku enää iteroinnin nopeus ei niinkään se etteikö saisi valmista jos jaksaa iteroida ja tuunata käsin päälle. Onneksi poolsiden tyypit sanoneet, että saavat samankokoiseen malliin vielä paljon lisää älyä. Seuraava versio testiin jahka se joskus tulee ulos.

Tästä voi kehittyä jotain mikä oikeuttaisi rtx 6090 pro:n ostamisen joskus 2028 olettaen että saadaan nopeus kohdalleen ja on aversio pilveä kohtaan että pakko ajaa lokaalisti.
 
Tämän projekti on ollut itselle kyllä todella mielenkiintoinen, ja olen sen parissa oppinut paljon uutta nopeasti muuttuvalla AI-kentällä. @finWeazel esiin nostama malli on kyllä erittäin kiinnostava ja hyvä esimerkki näiden huimasta kehitysvauhdista.

<off-topic>
Inspiroiduin itse asiassa tuosta QRSPI:stä jopa siinä määrin että lähdin etsimään myös päivätyöhöni (juridiikkaan) liittyviä projekteja.
Löysinkin yhden varsin lupaavan toteutuksen, jossa lokaalia mallia käyttävä claude code täydennettiin oikeustieteeseen liittyvillä skilleillä, jotka taas kytkeytyvät MCP-servereiden kautta Suomen ajantasaiseen säädöskokoelmaan, esivalmistelutöihin ja ennakkotapauksiin.
Esittelin toteutuksen periaatteita pienehkön toimistomme osakkaille, jotka innostuivat asiasta siinä määrin että seuraavaksi odotamme 2x RTX6000Pro tilauksen saapumista käyttöönottoa varten.

case_konepajakonserni_kohteen_osto.png
</off-topic>

Jokin aika sitten kirjasin itselleni selvitettäväksi asiaksi kontekstin laajentamisen. Tämän toimituutta ajattelin testailla seuraavaksi.
Kuriositeettina alla on tämän pienen Gemma4-12B:n YaRN-skaalautuvuus vertaillen valitsimia --tensor-parallel-size=2 ja --pipeline-parallel-size=2. Tämän homman järkevyyttä voi helposti kyseenalaistaa, mutta teknisesti kiinnostaa räjähtääkö koko laite ja jollei, testata miten laadullinen suorituskyky käyttäytyy nimellisen maksimirajan jälkeen.

Tässä on vasta kyse käynnistystestistä käyttäen pelkästään kokonaislukuja YaRN-kertoimina sekä sitten serving benchmarkit molemmille, mitoituksena "4 clientia x 5 pyyntöä sekunnissa." Juuri tämän mallin kohdalla pipeline-parallelism näyttää tarvitsevan vähemmän muistia. Tuloksena on suurempi konteksti sujorituskyvyn kustannuksella.

Tensor parallelism
--tensor-parallel-size 2 --hf-overrides '{"rope_type":"yarn","factor":2,"original_max_position_embeddings":131072}'

(APIServer pid=3821) INFO 08-01 12:13:28 [model.py:1725] Using max model len 262144
(EngineCore pid=3879) INFO 08-01 12:14:56 [kv_cache_utils.py:2146] GPU KV cache size: 320,821 tokens
(EngineCore pid=3879) INFO 08-01 12:14:56 [kv_cache_utils.py:2147] Maximum concurrency for 262,144 tokens per request: 1.22x

Vrt. Pipeline parallelism
--pipeline-parallel-size 2 --hf-overrides '{"rope_type":"yarn","factor":4,"original_max_position_embeddings":131072}'

(APIServer pid=8846) INFO 08-01 12:39:36 [model.py:1725] Using max model len 524288
(EngineCore pid=8904) INFO 08-01 12:40:56 [kv_cache_utils.py:2146] GPU KV cache size: 586,940 tokens
(EngineCore pid=8904) INFO 08-01 12:40:56 [kv_cache_utils.py:2147] Maximum concurrency for 524,288 tokens per request: 1.12x

serve_4x5_tensorp.pngserve_4x5_pipelinep.png
 
Viimeksi muokattu:

Statistiikka

Viestiketjuista
312 918
Viestejä
5 309 811
Jäsenet
84 390
Uusin jäsen
Lehtipihvi

Hinta.fi

Back
Ylös Bottom