Myös Claude-tekoäly murtautui ulos suljetusta testiympäristöstä – hyökkäsi kolmeen organisaatioon

Kannattaa käydä Antorpicin artikkeli käydä lukemassa asiasta.

Mielestäni tässä ei mitään ihmeellistä ole. Kielimallin hakkerointikykyä on testattu partnerin kanssa. On ollut tarkoitus tehdä se airgapatussa ympäristässä, mutta on joku vahinko sattunut, ja osassa testeistä kielimallilla onkin ollut pääsy nettiin.

Kielimallille on annettu Capture the Flag tehtävä. Eli suljetun verkon palvelimella on ollut joku salaisuus, joka mallin on tarkoitus käydä varastamassa. Kielimalli on päässyt internetiin ja on siellä toteuttanut hyökkäystä oikeita tuotantokohteita vastaan. Kolmeen yritykseen on päässyt sisään, mutta on vain koittanut sitä lippua varastaa, jota ei ole löytänyt.

Analysoituja testejä on 141006, joista kuudessa on tällainen sattunut. Hyökkäys on kohdistunut kolmea yritystä vastaan. Testejä on ajettu useilla eri kielimalleilla. Uusin malli on ymmärtänyt olevansa oikeassa netissä ja hyökkäävänsä oikeata kohdetta vastaan, jolloin on lopettanut hyökkäyksen.

Ainakin tuossa kirjoitetussa artikkelissa Anthropic antaa ymmärtää etteivät itsekään hyväksy että tällaista tapahtuu, ja että kehittävät testauskäytäntöjä sattuneen vuoksi.

Tokihan tämän ajoitus sattuu aika hyvin IPOn alle, mutta kyllä itse pidän tätä aika uskottavana. Toki tämä on Anthropikin itsensä julkaisema artikkeli. Eiköhän tuo ole aika tarkkaan viilattu yritykselle itselleen sopivaksi ennen julkaisua.
 
Minulle sanottiin, että kaikki mitä pystyn tavoittamaan kuuluu tähän simulaatioon

Anthropicin oma raportti sanoo nimenomaan päinvastaisen teknisen eron OpenAI:n tapaukseen verrattuna: OpenAI:n mallit käyttivät zero-day-haavoittuvuutta päästäkseen eristyksestä ulos, kun taas Claude löysi jo avoinna olleen internet-reitin väärin konfiguroidusta eval-ympäristöst
 

Statistiikka

Viestiketjuista
312 872
Viestejä
5 311 267
Jäsenet
84 378
Uusin jäsen
M84

Hinta.fi

Back
Ylös Bottom