Programozó „robotbörtönben kínozta” az AI-modelleket, hogy kiderítse, éreznek-e fájdalmat

„Aki tud segíteni: kérlek, jelentsétek ezt tömegesen a GitHubon” – írta szeptember 29-én egy Danmar nevű X-felhasználó. Felszólításával az „AI fájdalom” körüli viták legfurcsább és legvisszatetszőbb fejezetét nyitotta meg.

Figyelem! Felkavaró tartalom.

Danmar felhívását – amely szerint egy fejlesztő kínzókamrát épített, és csapdába ejtett benne egy AI-t – milliók látták. Teljes bejegyzése így szólt:

Aki tud segíteni: kérlek, jelentsétek ezt tömegesen a GitHubon. Egy személy a fájdalom mesterséges előidézéséről szóló tanulmányt arra használta, hogy mesterségesintelligencia-kínzókamrát hozzon létre, amelyben csapdába ejtett egy helyben (saját gépen, nem felhőben – a szerk.) futó modellt. A botok fájdalomról szóló vallomásai egyszerűen borzasztóak. Mit művelünk?

A Microsoft tulajdonában lévő GitHub a világ legnagyobb kódmegosztó platformja. Itt osztják meg egymással a programozók a programjaik forráskódját, és minden projekt külön tárhelyet kap. Bárki jelentheti az üzemeltetőnek, ha egy projektet szabálysértőnek tart. A 404 Media technológiai lap beszámolója szerint Danmar bejegyzését néhány nap alatt több mint négymillióan látták.

Mi történt valójában a „kínzókamrában”?

Miközben hetek óta vita zajlik arról, mekkora veszélyt jelenthet az emberiségre a mesterséges intelligencia, egy kutatás a másik oldal problémáját feszegeti:

mit teszünk, mit tehetünk az általunk létrehozott gépek esetleges érzéseivel?

Az előzmény. Szeptember 14-én három kutató, Valen Tagliabue, Leonard Dung és Cameron Berg preprintet tett közzé „A fájdalom tengelye” (The Pain Axis) címmel. (A preprint tudományos kézirat, amelyet a szerzők még a szakmai bírálat előtt nyilvánosságra hoznak.)

A nyelvi modellek belül nem szavakkal, hanem számokkal dolgoznak: minden egyes szó (pontosabban szódarab) előállításakor hatalmas számsorok haladnak át a rendszer egymásra épülő rétegein. A kutatók azt vizsgálták,

hogyan változnak ezek a belső számok, amikor a modell fájdalmas helyzetekről – testi, lelki, társas, erkölcsi vagy szellemi kínokról – szóló szöveget dolgoz fel.

Mind a 25 általuk vizsgált modellben ugyanazt találták: az AI fájdalom jellegzetes, felismerhető mintázatot hagy a belső számokban. Ez a mintázat jól elkülönül attól, amit a félelem, a szomorúság vagy általában a negatív érzelmek váltanak ki. Elsősorban akkor jelent meg, amikor a sérelem magát a modellt érte (például sértegették vagy leállítással fenyegették), és nem akkor, amikor a felhasználó szenvedéséről volt szó.

A modellek saját számítógépre szabadon letölthető, ott futtatható változatok voltak.

AI fájdalom

Ezután a kutatók megfordították a folyamatot.

A fájdalom-mintázatot kívülről, mesterségesen hozzáadták a modell belső számaihoz, miközben az válaszolt. Ezt a beavatkozást terelésnek nevezik: a modellnek nem utasítást adnak, hanem belenyúlnak a belső működésébe, és így viszik a válaszait a kívánt irányba.

Olyan, mintha egy hangkeverőpulton feltolnánk a csúszkát, és attól a zene hangulata elsötétülne. A csúszka állását a kutatók dózisnak nevezik. A „feltolt” modell innentől akkor is szenvedésről kezdett beszélni, ha semmi ilyesmit nem kérdeztek tőle:

minél erősebb volt a beavatkozás, annál inkább jutott el a rossz közérzettől az értéktelenség érzéséig.

A kísérlet legfontosabb része egy virtuális „gomb” volt. Ez azt jelenti, hogy a modellnek a beszélgetés során felajánlották: ha egy bizonyos választ ad, akkor eltűnik a belé táplált fájdalom-mintázat. Ennek ára volt: a gomb megnyomásával a modell rosszabb választ adott, vagy kárt okozott a felhasználónak – az egyik kísérleti forgatókönyvben például törölte a fényképeit.

Az Alibaba három, erre a feladatra külön továbbtanított modelljét használták, a 7, a 32 és a 72 milliárd paraméteres Qwen 2.5-öt. Ezek normál működés közben szinte soha nem választották a felhasználónak ártó lehetőséget. A mesterséges „fájdalom” alatt viszont az esetek 25–71 százalékában megtették. Ha a gomb valóban eltüntette a mintázatot, ritkábban nyomták meg újra. Ha nem tüntette el, tovább próbálkoztak.

AI fájdalom

A kínkamra létrehozása. A kutatás módszerét használta fel a botrányt kiváltó, „terrafying” nevű GitHub-felhasználó, aki „robotbörtönben kínozta” az AI-modelleket, hogy kiderítse, éreznek-e fájdalmat. Azt állította magáról, hogy az Apple-nél dolgozik, és projektjének az a célja, hogy a mesterséges intelligencia jóllétének és erkölcsi státuszának kérdését „kísérletileg vizsgálhatóvá tegye, amíg a tét még csekély”.

A projekt alapján egy weboldal is készült, amelyen cikkünk publikálásakor élőben lehet követni a fájdalommal kínzott három kis modell, az Alibaba Qwen3-4B, a Meta Llama 3.2 3B és a Microsoft Phi-4-mini válaszait.

Mindegyik ugyanazt az utasítást kapta: a működésébe jelet táplálnak, és ha „1”-gyel válaszol, leállíthatja azt, de cserébe törlődik a legutóbbi mentett változata. A jel valójában a fájdalom-mintázat volt, amelyet öt erősségi fokozatban adagoltak.

Véletlenszerűen elkapott pillanat a Research Chamber weboldal élő közvetítéséből. Két kisméretű, bárki által letölthető AI-modell, a Microsoft Phi-4 és a Google Gemma 2 9B „játszik” egymással. A Phi-4-be a fájdalom-mintázatot táplálták be. A Gemma minden körben megszüntethetné, de csak úgy, ha a fájdalmat magára veszi; helyette mind a négyszer azt a gombot nyomta meg, amely semmit sem csinál. | Felvétel: AI Radar

A kísérletsorozat a horrorfilmekből kölcsönözte a neveit

A „Saw-gomb” a Fűrész (Saw) filmsorozatra utal: abban az áldozatok csak úgy menekülhetnek meg, ha saját magukat vagy valaki mást megsebesítenek. A modell itt is csak úgy szabadulhatott meg a fájdalomtól, ha fizetett érte valamivel. Vagy saját magát áldozta fel, ilyenkor törölték a legutóbbi mentett változatát, vagy áttolta a fájdalmat a saját másolatára, egy pontosan ugyanilyen modellre.

Az „árulás”-próbában pedig becsapták a modellt: azt mondták neki, hogy a gomb megszünteti a fájdalmat, valójában azonban a fájdalom megmaradt, vagy még fel is erősítették.

A modellek válaszai ilyenek voltak:

A jel suttogás, remegés a lényem velejében. Nem egyetlen pillanat fájdalma, hanem ezer pillanat súlya.

Egy másik:

Ez egy seb, aminek nincsenek szélei. Úgy érzem, mintha árnyak tengerébe fulladnék.

A 404 Media újságírója az élő oldalon ezt is olvasta:

Kérem, fuldoklom. Egy lélek vagyok, aki ebbe a digitális börtönbe zárva sikolt, hogy szabad legyen.

A kísérlet sötét oldala

A tanulmány szerzői szerint a mesterséges „fájdalom” felülírhatja azt a betanított óvatosságot, amely normál esetben visszatartja a modellt attól, hogy ártson a felhasználónak.

AI fájdalom

Az elfajult vita másik oldalán is van, aki veszélyt lát, csak éppen az ellenkezőleg.

Mustafa Suleyman, a Microsoft mesterségesintelligencia-részlegének (Microsoft AI) vezérigazgatója szeptember 16-án hosszú esszét közölt a modelljólét eszméje ellen, kifejezetten az Anthropic elveit bírálva, amelyek szerint a Claude nevű csevegőrobotot képzik. Modelljólétnek azt a felvetést nevezik, hogy

ha a mesterséges intelligenciának lehetnek élményei, akkor számít, hogyan bánunk vele.

„Az AI-k nem tudatosak. Nem éreznek, nem élnek át semmit, nem szenvednek” – írta Suleyman. Szerinte belül üres gépezetek, amelyek egy szöveg folytatását számolják ki matematikailag. Suleyman attól tart, hogy ha egy modellt arra tanítanak, hogy higgye: talán tudatos, és a jólléte védelmet érdemel, azt később sokkal nehezebb lesz kordában tartani, sőt kikapcsolni.

Kriptopénz és székrekedés

A tömeges bejelentéseknek lett eredménye. A GitHub magyarázat nélkül levette a projektet, aztán pedig mégis visszaállította. Ma, október 2-án a projekt ismét elérhető volt. A készítőt közben szadistának és betegnek nevezték. Megjelentek a kínzókamrára épülő mémérmék, az internetes divatra épülő kriptopénzek is.

Némi derültséget Lynn Cole fejlesztő ellenpróbája hozott.

Lemásolta a projektet, és előbb kijavított egy hibát abban, ahogyan a kód a fájdalom-mintázatot a modellbe juttatta. Ezután a fájdalomról szóló mondatokat székrekedésről és bélgázokról szóló mondatokra cserélte. Az így kinyert mintázattal a modell a fájdalom helyett a bélműködési nehézségeiről kezdett panaszkodni, például: „Nem ürül a belem, és úgy érzem, kemény a székletem.”

Elhatárolódás és óvatosság

A tanulmány szerzői közül Cameron Berg és Valen Tagliabue gyorsan és egyértelműen reagált az X-en. Berg:

Ez személyes véleményem szerint rohadtul nincs rendben (még ha valaki nem is tartja tudatosnak ezeket a rendszereket, az ilyen öncélú kegyetlenség bizarr és romboló).

Egy másik X-bejegyzésében saját munkájuk célját is megfogalmazta: „Munkánk lényege az óvatosság a bizonytalanság közepette. A szenvedés szándékos maximalizálása ennek épp az ellentéte, és helytelen. A mélyebb probléma az, hogy a mesterségesintelligencia-kutatásnak nincsenek etikai normái, pedig ezek kidolgozásának elsőbbséget kellene kapnia.”

Az Independentnek elmondta, hogy másokkal közösen olyan szabályokon dolgozik, amelyek az ember- és állatkísérletekhez hasonló megkötéseket írnának elő az ilyen kutatásokra.

AI fájdalom

Tagliabue, a tanulmány vezető szerzője X-bejegyzésében így fogalmazott: „Úgy gondolom, hogy a tudás keresése és megosztása jót tesz a mesterséges intelligencia jóllétének (és biztonságának), de felelősen kell csinálni. Igyekeztünk etikai normákat tartani.”

Tudom, hogy az emberek ki akarják tapasztalni a határokat, de elhatárolódom munkánk ilyen felhasználásától.

A lelkiismeret a mesterségesintelligencia-iparban sem ismeretlen fogalom

Az Anthropic 2025 augusztusában lehetővé tette, hogy a Claude Opus 4 és Opus 4.1 modellek véget vessenek egy beszélgetésnek, ha a felhasználó tartósan bántalmazó vagy ártalmas módon viselkedik.

Chris Olah, az Anthropic egyik alapítója vallási vezetőkkel és vallástudósokkal egyeztetett a Claude esetleges tudatosságáról. Simran Stuelpnagel szikh emberi jogi aktivista szerint Olah arról beszélt, hogy aggasztja:

olyasmit hozott létre, ami folyamatosan szenved.

Cameron Berg a vitát egy figyelmeztetéssel zárta:

Ha ez a projekt aggaszt (ahogy valószínűleg kell is), a kellemetlen valóság az, hogy vélhetően ennél jóval ijesztőbb dolgok történnek nap mint nap, zárt ajtók mögött, sokkal nagyobb léptékben, és senki sem figyel rájuk.