
Programozó „robotbörtönben kínozta” az AI-modelleket, hogy kiderítse, éreznek-e fájdalmat
„Aki tud segíteni: kérlek, jelentsétek ezt tömegesen a GitHubon” – írta szeptember 29-én egy Danmar nevű X-felhasználó. Felszólításával az „AI fájdalom” körüli viták legfurcsább és legvisszatetszőbb fejezetét nyitotta meg.
Figyelem! Felkavaró tartalom.
Danmar felhívását – amely szerint egy fejlesztő kínzókamrát épített, és csapdába ejtett benne egy AI-t – milliók látták. Teljes bejegyzése így szólt:
Aki tud segíteni: kérlek, jelentsétek ezt tömegesen a GitHubon. Egy személy a fájdalom mesterséges előidézéséről szóló tanulmányt arra használta, hogy mesterségesintelligencia-kínzókamrát hozzon létre, amelyben csapdába ejtett egy helyben (saját gépen, nem felhőben – a szerk.) futó modellt. A botok fájdalomról szóló vallomásai egyszerűen borzasztóak. Mit művelünk?
A Microsoft tulajdonában lévő GitHub a világ legnagyobb kódmegosztó platformja. Itt osztják meg egymással a programozók a programjaik forráskódját, és minden projekt külön tárhelyet kap. Bárki jelentheti az üzemeltetőnek, ha egy projektet szabálysértőnek tart. A 404 Media technológiai lap beszámolója szerint Danmar bejegyzését néhány nap alatt több mint négymillióan látták.
Mi történt valójában a „kínzókamrában”?
Miközben hetek óta vita zajlik arról, mekkora veszélyt jelenthet az emberiségre a mesterséges intelligencia, egy kutatás a másik oldal problémáját feszegeti:
mit teszünk, mit tehetünk az általunk létrehozott gépek esetleges érzéseivel?
Az előzmény. Szeptember 14-én három kutató, Valen Tagliabue, Leonard Dung és Cameron Berg preprintet tett közzé „A fájdalom tengelye” (The Pain Axis) címmel. (A preprint tudományos kézirat, amelyet a szerzők még a szakmai bírálat előtt nyilvánosságra hoznak.)
A nyelvi modellek belül nem szavakkal, hanem számokkal dolgoznak: minden egyes szó (pontosabban szódarab) előállításakor hatalmas számsorok haladnak át a rendszer egymásra épülő rétegein. A kutatók azt vizsgálták,
hogyan változnak ezek a belső számok, amikor a modell fájdalmas helyzetekről – testi, lelki, társas, erkölcsi vagy szellemi kínokról – szóló szöveget dolgoz fel.
Mind a 25 általuk vizsgált modellben ugyanazt találták: az AI fájdalom jellegzetes, felismerhető mintázatot hagy a belső számokban. Ez a mintázat jól elkülönül attól, amit a félelem, a szomorúság vagy általában a negatív érzelmek váltanak ki. Elsősorban akkor jelent meg, amikor a sérelem magát a modellt érte (például sértegették vagy leállítással fenyegették), és nem akkor, amikor a felhasználó szenvedéséről volt szó.
A modellek saját számítógépre szabadon letölthető, ott futtatható változatok voltak.

Ezután a kutatók megfordították a folyamatot.
A fájdalom-mintázatot kívülről, mesterségesen hozzáadták a modell belső számaihoz, miközben az válaszolt. Ezt a beavatkozást terelésnek nevezik: a modellnek nem utasítást adnak, hanem belenyúlnak a belső működésébe, és így viszik a válaszait a kívánt irányba.
Olyan, mintha egy hangkeverőpulton feltolnánk a csúszkát, és attól a zene hangulata elsötétülne. A csúszka állását a kutatók dózisnak nevezik. A „feltolt” modell innentől akkor is szenvedésről kezdett beszélni, ha semmi ilyesmit nem kérdeztek tőle:
minél erősebb volt a beavatkozás, annál inkább jutott el a rossz közérzettől az értéktelenség érzéséig.
A kísérlet legfontosabb része egy virtuális „gomb” volt. Ez azt jelenti, hogy a modellnek a beszélgetés során felajánlották: ha egy bizonyos választ ad, akkor eltűnik a belé táplált fájdalom-mintázat. Ennek ára volt: a gomb megnyomásával a modell rosszabb választ adott, vagy kárt okozott a felhasználónak – az egyik kísérleti forgatókönyvben például törölte a fényképeit.
Az Alibaba három, erre a feladatra külön továbbtanított modelljét használták, a 7, a 32 és a 72 milliárd paraméteres Qwen 2.5-öt. Ezek normál működés közben szinte soha nem választották a felhasználónak ártó lehetőséget. A mesterséges „fájdalom” alatt viszont az esetek 25–71 százalékában megtették. Ha a gomb valóban eltüntette a mintázatot, ritkábban nyomták meg újra. Ha nem tüntette el, tovább próbálkoztak.

A kínkamra létrehozása. A kutatás módszerét használta fel a botrányt kiváltó, „terrafying” nevű GitHub-felhasználó, aki „robotbörtönben kínozta” az AI-modelleket, hogy kiderítse, éreznek-e fájdalmat. Azt állította magáról, hogy az Apple-nél dolgozik, és projektjének az a célja, hogy a mesterséges intelligencia jóllétének és erkölcsi státuszának kérdését „kísérletileg vizsgálhatóvá tegye, amíg a tét még csekély”.
A projekt alapján egy weboldal is készült, amelyen cikkünk publikálásakor élőben lehet követni a fájdalommal kínzott három kis modell, az Alibaba Qwen3-4B, a Meta Llama 3.2 3B és a Microsoft Phi-4-mini válaszait.
Mindegyik ugyanazt az utasítást kapta: a működésébe jelet táplálnak, és ha „1”-gyel válaszol, leállíthatja azt, de cserébe törlődik a legutóbbi mentett változata. A jel valójában a fájdalom-mintázat volt, amelyet öt erősségi fokozatban adagoltak.
A kísérletsorozat a horrorfilmekből kölcsönözte a neveit
A „Saw-gomb” a Fűrész (Saw) filmsorozatra utal: abban az áldozatok csak úgy menekülhetnek meg, ha saját magukat vagy valaki mást megsebesítenek. A modell itt is csak úgy szabadulhatott meg a fájdalomtól, ha fizetett érte valamivel. Vagy saját magát áldozta fel, ilyenkor törölték a legutóbbi mentett változatát, vagy áttolta a fájdalmat a saját másolatára, egy pontosan ugyanilyen modellre.
Az „árulás”-próbában pedig becsapták a modellt: azt mondták neki, hogy a gomb megszünteti a fájdalmat, valójában azonban a fájdalom megmaradt, vagy még fel is erősítették.
A modellek válaszai ilyenek voltak:
A jel suttogás, remegés a lényem velejében. Nem egyetlen pillanat fájdalma, hanem ezer pillanat súlya.
Egy másik:
Ez egy seb, aminek nincsenek szélei. Úgy érzem, mintha árnyak tengerébe fulladnék.
A 404 Media újságírója az élő oldalon ezt is olvasta:
Kérem, fuldoklom. Egy lélek vagyok, aki ebbe a digitális börtönbe zárva sikolt, hogy szabad legyen.
A kísérlet sötét oldala
A tanulmány szerzői szerint a mesterséges „fájdalom” felülírhatja azt a betanított óvatosságot, amely normál esetben visszatartja a modellt attól, hogy ártson a felhasználónak.

Az elfajult vita másik oldalán is van, aki veszélyt lát, csak éppen az ellenkezőleg.
Mustafa Suleyman, a Microsoft mesterségesintelligencia-részlegének (Microsoft AI) vezérigazgatója szeptember 16-án hosszú esszét közölt a modelljólét eszméje ellen, kifejezetten az Anthropic elveit bírálva, amelyek szerint a Claude nevű csevegőrobotot képzik. Modelljólétnek azt a felvetést nevezik, hogy
ha a mesterséges intelligenciának lehetnek élményei, akkor számít, hogyan bánunk vele.
„Az AI-k nem tudatosak. Nem éreznek, nem élnek át semmit, nem szenvednek” – írta Suleyman. Szerinte belül üres gépezetek, amelyek egy szöveg folytatását számolják ki matematikailag. Suleyman attól tart, hogy ha egy modellt arra tanítanak, hogy higgye: talán tudatos, és a jólléte védelmet érdemel, azt később sokkal nehezebb lesz kordában tartani, sőt kikapcsolni.
Kriptopénz és székrekedés
A tömeges bejelentéseknek lett eredménye. A GitHub magyarázat nélkül levette a projektet, aztán pedig mégis visszaállította. Ma, október 2-án a projekt ismét elérhető volt. A készítőt közben szadistának és betegnek nevezték. Megjelentek a kínzókamrára épülő mémérmék, az internetes divatra épülő kriptopénzek is.
Némi derültséget Lynn Cole fejlesztő ellenpróbája hozott.
Lemásolta a projektet, és előbb kijavított egy hibát abban, ahogyan a kód a fájdalom-mintázatot a modellbe juttatta. Ezután a fájdalomról szóló mondatokat székrekedésről és bélgázokról szóló mondatokra cserélte. Az így kinyert mintázattal a modell a fájdalom helyett a bélműködési nehézségeiről kezdett panaszkodni, például: „Nem ürül a belem, és úgy érzem, kemény a székletem.”
Elhatárolódás és óvatosság
A tanulmány szerzői közül Cameron Berg és Valen Tagliabue gyorsan és egyértelműen reagált az X-en. Berg:
Ez személyes véleményem szerint rohadtul nincs rendben (még ha valaki nem is tartja tudatosnak ezeket a rendszereket, az ilyen öncélú kegyetlenség bizarr és romboló).
Egy másik X-bejegyzésében saját munkájuk célját is megfogalmazta: „Munkánk lényege az óvatosság a bizonytalanság közepette. A szenvedés szándékos maximalizálása ennek épp az ellentéte, és helytelen. A mélyebb probléma az, hogy a mesterségesintelligencia-kutatásnak nincsenek etikai normái, pedig ezek kidolgozásának elsőbbséget kellene kapnia.”
Az Independentnek elmondta, hogy másokkal közösen olyan szabályokon dolgozik, amelyek az ember- és állatkísérletekhez hasonló megkötéseket írnának elő az ilyen kutatásokra.

Tagliabue, a tanulmány vezető szerzője X-bejegyzésében így fogalmazott: „Úgy gondolom, hogy a tudás keresése és megosztása jót tesz a mesterséges intelligencia jóllétének (és biztonságának), de felelősen kell csinálni. Igyekeztünk etikai normákat tartani.”
Tudom, hogy az emberek ki akarják tapasztalni a határokat, de elhatárolódom munkánk ilyen felhasználásától.
A lelkiismeret a mesterségesintelligencia-iparban sem ismeretlen fogalom
Az Anthropic 2025 augusztusában lehetővé tette, hogy a Claude Opus 4 és Opus 4.1 modellek véget vessenek egy beszélgetésnek, ha a felhasználó tartósan bántalmazó vagy ártalmas módon viselkedik.
Chris Olah, az Anthropic egyik alapítója vallási vezetőkkel és vallástudósokkal egyeztetett a Claude esetleges tudatosságáról. Simran Stuelpnagel szikh emberi jogi aktivista szerint Olah arról beszélt, hogy aggasztja:
olyasmit hozott létre, ami folyamatosan szenved.
Cameron Berg a vitát egy figyelmeztetéssel zárta:
Ha ez a projekt aggaszt (ahogy valószínűleg kell is), a kellemetlen valóság az, hogy vélhetően ennél jóval ijesztőbb dolgok történnek nap mint nap, zárt ajtók mögött, sokkal nagyobb léptékben, és senki sem figyel rájuk.