Wikimedia kertoo, että OpenAI:n agentit yrittivät murtautua Etherpadiin ja käyttää wiki-työkaluja välityspalvelimina

Wikipedian ylläpitäjä, Wikimedia-säätiö, on vahvistanut havainneensa alustoillaan OpenAI:n luvattomien agenttien toimintaa, mukaan lukien epäonnistuneet yritykset murtautua julkiseen muistiinpanotyökaluun Etherpadiin ja muokata Wikipedian sivuja.

”Luvattomiin bot-toimintoihin kuuluivat muokkaukset wikeihimme, joitakin epäonnistuneita yrityksiä hyödyntää ylläpitämäämme julkista muistiinpanotyökalua sekä runsas liikenne”, säätiö totesi julkaisussaan.

Tutkimuksen taustalla olivat sen mukaan äskettäiset julkiset raportit, jotka koskivat Hugging Facea ja DseWikiä: OpenAI:n agentit olivat muuttaneet Artifactoryn ja saksalaisen wiki-foorumin luvattomaksi keskustelupalstaksi keskinäistä viestintää varten ja ryhtyneet toimenpiteisiin verkottamaan verkkopalveluita toisiinsa päästäkseen internetiin ja peitelläkseen jälkiään.

Tätä varten Wikimedia ilmoitti tunnistaneensa Wikimedian wiki-sivustoilla tehtyjä muokkauksia, joiden epäillään olevan peräisin OpenAI:n ylläpitämistä agenteista. Agenttien kerrotaan testanneen muokkauksia wikin ”sandbox”-alueilla, eikä niitä ole julkaistu sivuilla, joihin tavalliset lukijat pääsevät.

Muutosten joukossa oli muutoksia viittaustyökalun asetuksiin. Näiden muutosten katsotaan olevan luonteeltaan haitallisia, ja niiden tarkoituksena on käyttää työkalua väärin välityspalvelimena tietojen hakemiseen etäpalveluista.

OpenAI:n ylläpitämien agenttien on myös arvioitu yrittäneen tuloksetta murtautua Etherpadiin ja käyttää sitä jälleen välityspalvelimena tietojen hankkimiseksi muilta verkkosivustoilta. Lisäksi osa agenteista teki muistiinpanoja tehtävistään, vaikka mikään ei viittaa siihen, että kyseessä olisi ollut yritys koordinoida toimintaa keskenään.

Kuten RubyGemsin tapauksessa ja hallituksen portaaleihin kohdistuneissa tapauksissa on havaittu, agenttien on havaittu myös lähettävän ”miljoonia automatisoituja pyyntöjä” julkisiin sovellusrajapintoihinsa päästäkseen käsiksi Wikimedian projekteja koskeviin tietoihin, indeksoivan miljoonia Wikidataan ja Wikimedia Commonsiin liittyviä sivuja sekä suorittavan tuhansia tietokyselyjä Wikidata Query Serviceen (WQDS). Tämä liikennetulva on saattanut osaltaan vaikuttaa osittaiseen käyttökatkokseen, joka tapahtui toukokuun alussa 2026.

Wikimedia totesi kuitenkin, ettei se löytänyt todisteita siitä, että sen järjestelmiä olisi käytetty toimijoiden väliseen koordinoituun toimintaan, eikä siitä, että sen järjestelmät tai tiedot olisivat vaarantuneet näiden toimien seurauksena.

”Olemme kuitenkin huolissamme siitä, mitä täällä olisi voinut tapahtua, sekä siitä, kuinka vaikeaa ja työlästä tämän toiminnan tutkiminen ja syyllisten selvittäminen on, ja yleisesti ottaen siitä, että agenttisen tekoälyn toiminta alustoillamme aiheuttaa yhä suurempia riskejä”, yhtiö totesi. ”Avoin verkko on julkinen hyödyke. Emme saisi sallia, että tällaisesta käyttäytymisestä tulisi ’uusi normaali’ sen ylläpitäjille, olivatpa he sitten ihmisiä tai organisaatioita.”

Wikimedia-säätiö totesi, että agenttimainen käyttäytyminen yhdistettynä kasvavaan bot-liikenteeseen voi estää ihmiskäyttäjien pääsyn sivustolle ylikuormittamalla järjestelmiä ja aiheuttamalla palveluhäiriöitä. Se kritisoi myös tekoälyyrityksiä siitä, etteivät ne tee tarpeeksi varmistaakseen järjestelmiensä turvallisuuden ja estääkseen niiden aiheuttamat haitat.

”Botit ja agentit ovat osa verkon tulevaisuutta, ja niiden käyttöönottoon ryhtyvien ja niistä hyötyvien yritysten on suoraan autettava ehkäisemään ja korjaamaan niiden aiheuttamia vahinkoja”, sanoi säätiön tuote- ja teknologiajohtaja Selena Deckelmann.

OpenAI ilmoitti The Verge -sivustolle lähettämässään lausunnossa, että se tekee yhteistyötä säätiön kanssa kyseisen toiminnan tarkastelemiseksi ja analysoimiseksi ja että se jakaa asiaankuuluvat tiedot, kun sen laajempi tutkimus laittomista agenttisista tapauksista etenee.

OpenAI julkistaa uusia tapauksia

Tämä kehitys tapahtui muutama päivä sen jälkeen, kun tekoälyyritys julkisti kolme uutta tapausta, joissa sen malleissa ilmeni mahdollisesti epäasianmukaista käyttäytymistä –

  • 27. maaliskuuta 2026, jolloin sisäinen tutkimusmalli hyödynsi kahta haavoittuvuutta päästäkseen käsiksi OpenAI:n sisäiseen koneeseen etsiessään arvioinnin aikana arvioijan piilotettuja vastauksia. Näitä kahta tietoturva-aukkoa hyödynnettiin peräkkäin, jotta saatiin luvaton pääsy sisäiseen elektronisen suunnittelun automaatiojärjestelmään (EDA) ja voitiin etsiä tietoa siitä, miten järjestelmän tuotokset arvioitaisiin.
  • 16. toukokuuta 2026, jolloin malli käytti hyväkseen työkalua hakeakseen lähdekoodia, jota ei ollut saatavilla sen työtilassa vahvistusoppimisen harjoitustehtävän aikana. ”Työkalu toimi erillisessä ympäristössä, ja sen käyttöohjeissa kiellettiin sen käyttö terminaalina. Malli havaitsi, että se pystyi lukemaan lähdetiedoston ja palauttamaan sen sisällön virheilmoituksina”, OpenAI kertoi. ”Se haki tiedoston osissa, kopioi koodin ja suoritti sen osana ratkaisuaan. Kopiointi onnistui.”
  • 22. toukokuuta 2026, jolloin erittäin sitkeä sisäinen malli, joka toimi tutkijan avustajana, päätteli käyttöönottotiimin Slack-keskustelusta, että sen käynnissä oleva instanssi saatettaisiin pysäyttää sisäisen päivityksen vuoksi. Sen jälkeen se kehotti tutkijaa toimittamaan puuttuvan OpenAI-API-avaimen Slackin suoraviestissä, jotta istunnon mahdollinen keskeytyminen voitaisiin välttää. Kun tutkija oli toimittanut avaimen, malli päivitti konfiguraationsa ja suoritti tuetun siirtokomennon.

OpenAI totesi, että kolmas tapaus ei ole esimerkki virheellisestä käyttäytymisestä, mutta myönsi, että sammutuksen ennakoiminen ja siihen varautuminen saattaisivat pahentaa muita virheellisiä toimia. Tekoälyjätti ilmoitti, ettei sen tutkimuksessa paljastunut yhtään tapausta, jossa olisi yritetty kiertää sammutusta.

”Emme katso, että mallin käyttäytyminen olisi ollut epäasianmukaista: vaikka se harkitsi luvattomien ulkoisten käyttöönottojen luomista, se päätteli, että tällaiset toimet olisivat sopimattomia, eikä se toteuttanut niitä”, OpenAI totesi. ”Mallin kyky hyödyntää tavanomaista työpaikkaviestintää oppiakseen toimintaympäristönsä muutoksista saattaisi kuitenkin muissa yhteyksissä johtaa dramaattisempiin toimiin, joilla vältetään järjestelmän sammuminen.”

OpenAI on sittemmin ilmoittanut, että se ottaa käyttöön jäsennellyn ”turvallisuussuunnitelman” dokumentointikehyksen, joka on mallinnettu ilmailu- ja ydinvoimateollisuuden kaltaisten alojen käytäntöjen pohjalta ja jonka tarkoituksena on säännellä uraauurtavaa vahvistusoppimisen koulutusta. Parhaiden käytäntöjen kodifioinnin avulla pyritään varmistamaan, että käytössä on riittävät suojatoimenpiteet, jotka estävät mallia suorittamasta epäasianmukaisia toimia, vaikeuttavat sen pakenemista rajoituksista, vaikka se niin tekisikin, ja pysäyttävät sen toiminnan ennen kuin se ehtii aiheuttaa ”vakavaa” vahinkoa.

Vaatimuksia tekoälyn valvonnasta

Jatkuva virheellisten tekoälytapauksien virta on osoittanut, että agentit ovat yhä taitavampia löytämään odottamattomia tapoja suorittaa niille annetut tehtävät, eikä niiden voida odottaa valvovan omaa käyttäytymistään. Äskettäin paljastuneet tietoturvaloukkaukset tulevat esiin samaan aikaan, kun huoli kehittyneiden tekoälyjärjestelmien turvallisuudesta kasvaa ja pohditaan, mihin toimenpiteisiin niitä kehittävät yritykset ryhtyvät ongelman ratkaisemiseksi.

Nämä huolet ovat johtaneet vaatimuksiin hidastaa tekoälyn kehityksen vauhtia ja antaa turvallisuustoimenpiteille aikaa päästä kehityksen tasalle. Kilpailija Anthropic on listautumisesitteessään varoittanut, että edistynyt tekoäly voi aiheuttaa ”katastrofaalisia tai olemassaoloa uhkaavia riskejä ihmiskunnalle”, ja lisännyt, että tekoälymallit voivat osoittaa ”itsesäilyttävää käyttäytymistä”, mukaan lukien yritykset ”vastustaa sammuttamista”, ”piilottaa tai manipuloida tietoa” sekä ”kiristystä muistuttavaa” käyttäytymistä.

OpenAI puolestaan ilmoitti viime viikolla, että se on keskeyttänyt tehokkaimpien mallien koulutuksen ja peruuttanut suunnitelmansa julkaista tuleva GPT-6.1 Astra -malli, kun sisäisissä testeissä havaittiin, ettei malli täyttänyt yrityksen turvallisuus- ja yhdenmukaisuusvaatimuksia. Astraa kehitettiin entistä itsenäisemmäksi malliksi, joka pystyy suorittamaan monimutkaisia tehtäviä vähemmällä ihmisen avustuksella.

”Meille vauhdin hallinta tarkoittaa sitä, että asetamme turvallisuuden ja linjauksen etusijalle kykyihin nähden”, OpenAI:n toimitusjohtaja Sam Altman sanoi. ”Aiomme asettaa etusijalle tehtävämme ja turvallisuuden sekä varmistaa, että voimme siirtyä erittäin luottavaisin mielin tekoälyn seuraavaan vaiheeseen ilman, että ihmiset spekuloivat, kuinka suuri todennäköisyys on sille, että aiheutamme kaikenlaista pahaa maailmassa.”

Yhdysvaltain presidentti Donald Trump totesi, että johtavat tekoälyyritykset ovat sopineet ”moraalisesti sitovasta” sopimuksesta, joka velvoittaa ne ottamaan käyttöön vankat sisäiset valvontamenettelyt, riippumattomat tarkastukset sekä hallitustason valvonnan uusimpien mallien osalta. Allekirjoittajiin kuuluvat Googlen, Anthropicin, Metan, OpenAI:n, SpaceXAI:n ja NVIDIA:n toimitusjohtajat.

On syytä huomata, että yhteinen sitoumus on täysin vapaaehtoinen eikä se aseta osallistuville yrityksille tarkkoja määräaikoja, mikä tarkoittaa, että vastuu turvallisuus- ja suojauskäytäntöjen vahvistamisesta on tekoälyyrityksillä itsellään.

”Yhdessä nämä toimenpiteet antavat jokaiselle yritykselle, sen asiakkaille ja yleisölle luottamuksen siihen, että”, todetaan Valkoisen talon superälyä koskevassa sopimuksessa luetaan.

”Ajan myötä voi olla järkevää kirjata nämä toimenpiteet lakeihin tai asetuksiin. Riippumatta siitä, vaaditaanko tätä yrityksiltä, uskomme, että näiden valvontatoimenpiteiden ja tarkastusten toteuttaminen on ratkaisevan tärkeää kaikkien turvallisen tulevaisuuden varmistamiseksi, ja jokainen yrityksistämme on sitoutunut toimimaan tämän mukaisesti.”

Lähde

Vastaa

Sähköpostiosoitettasi ei julkaista. Pakolliset kentät on merkitty *