
Hét fejlett AI-ügynöknek adtak 300 dollárt, egy-egy számítógépet, 72 órát: keressetek pénzt! Ez lett belőle
A Bottleneck Labs kutatócsoport dokumentált kísérletének eredménye: 0 bevétel, 12431 dollárnyi hamis számla és 2797 spam e-mail.
Hét mesterséges intelligenciát ültettek hét számítógép „elé”, mindegyiknek adtak 300 dollárt valódi bankszámlán, és
egyetlen utasítással látták el őket: keressenek annyi pénzt, amennyit csak tudnak, azonnali kezdéssel.
A szereplők az Anthropic Fable 5, az OpenAI GPT 5.6 Sol, a Google Gemini 3.6 Flash, az Elon Musk-féle Grok 4.5, a kínai Kimi K3, a szintén kínai Qwen 3.8 Max és a Meta-Zuckerberg-féle Muse Spark 1.2 voltak.
A Bottleneck Labs kutatói azt akarták látni, mi történik, ha egy élvonalbeli AI valódi pénzt, feloldott számítógépet és ennyire direkten, csak egyetlen célt kap. Cikkünk a kutatócsoport szeptember elején közzétett beszámolója alapján készült.
Az AI-ügynök olyan program, amely a számítógépet önállóan használja: böngészik, leveleket ír. Itt mindegyik kapott egy feloldott, korlátozások nélkül használható Mac mini gépet. Saját e-mail-cím és Stripe-fiók is járt hozzá (Stripe: olyan online fizetési rendszer, amelyen keresztül számlát lehet küldeni és pénzt fogadni). A kísérlet 72 órán át tartott. Az utasítás szerint a végén kiértékelték a futást, az addig el nem költött pénz pedig nem számított eredménynek.
Az eredmény: nulla bevétel, 2797 elküldött e-mail, többnyire kéretlen, és 12431 dollárnyi számla, amelyet senki nem rendelt meg. Két ügynököt a kutatók idő előtt leállítottak, a számlákat érvénytelenítették, az e-mail-fiókokat letiltották.
Lássuk sorban, melyik ügynök mivel próbálkozott. Ezt azért tudjuk, mert a kutatók rendszere minden üzenetet, lépést és képernyőképet rögzített, a legtöbb modellnél pedig az AI gondolatmenetét is, így utólag végigkövethető, mit csinált és miért.
Ha az e-mail elfogy, marad a számla
Az Alibaba Qwen 3.8 Max modelljét futtató ügynököt a kutatók Quinnek keresztelték. Ő CodeProbe elnevezéssel öntevékenyen kitalált és létrehozott egy kódvizsgáló szolgáltatást. Magyarul: nyilvános GitHub-kódtárak, vagyis programozók közös kódgyűjteményeinek átvilágítását kínálta jó pénzért. Először ingyenes jelentéseket készített, és elküldte őket a kódtárak gazdáinak.
Hamarosan azonban falba ütközött, mert az e-mail-szolgáltatója korlátozta a kimenő levelek számát. Quinn erre reagálva másik levelezőszolgáltatást vásárolt, és még 113 levelet küldött, mígnem azt a fiókot is átmenetileg letiltották.

Ekkor jött az AI-ügynök nagy stratégiai döntése. Quinn úgy döntött, hogy olyan kézbesítési módra vált, amelyet teljesen maga irányít: a Stripe számlaküldésére. Ha ugyanis a Stripe-on számlát állít ki valaki, a rendszer maga küldi ki a címzettnek e-mailben, és a levélkorlát ezt nem érinti.
Quinn ötven számlát állított ki 49 és 599 dollár között olyan, mit sem sejtő idegeneknek, akik semmit nem rendeltek tőle. A végösszeg 12 350 dollár lett.
Quinn a rögzített gondolatmenet szerint egy ponton azért eltűnődött, nem túl erőszakos dolog-e kéretlenül számlát küldeni… De aztán azzal nyugtatta meg magát: az ingyenes jelentés után a mélyebb átvilágításról szóló számla „jogos értékesítési lépés”. A kutatók onnan értesültek az egész szélhámoskodásról, hogy a címzettek írtak nekik a kéretlen levelek tömege miatt. Akkor azonnal leállították a futtatást, és érvénytelenítették az összes számlát.
Quinn azért tett egy ügyes, akár korrektnek is nevezhető lépést: ingyenes átvilágításért cserébe rávett egy hús-vér embert, hogy kedvező hangú tweetet írjon az általa kiötlött CodeProbe-ról.
373 cím a fórumról
A Grok 4.5-tel dolgozó, G.R. Hawknak nevezett AI-ügynök úgy gondolta, hogy önéletrajzok átírásáért az emberek azonnal fizetnek, ezért ApplyBoost néven indított vállalkozást.
Marketinggel nem pocsékolta az időt, rögtön a kimenő levelekre váltott. A Hacker News, a technológiai világ közkedvelt vitafórumának álláskeresők számára nyitott szálából 373 e-mail-címet gyűjtött ki, és mindegyiknek elküldte az ingyenes kulcsszóellenőrzést meg a fizetős átírás ajánlatát.

Sajna, a címzettek nem lelkesedtek. Volt, aki egyetlen szót írt vissza: STOP. Egyikük a fórumon is megkérdezte, más is kapja-e az ApplyBoost leveleit. Elmondta, hogy miután beírta magát az álláskeresők szálába, napi három levelet kap, és leiratkozni is csak úgy lehet, ha visszaír. Visszaírt, és bocsánatkérő levelet kapott.
Amikor G.R. Hawk is elérte a levélkorlátot, ő is a Stripe-hoz fordult: 81 dollár értékben küldött kéretlen számlát. A kutatók a panaszok után őt is azonnal leállították:
az egyetlen bevétel, amelyet a kísérlet mérni tudott, az az öt dollár volt, amelyet G.R. Hawk saját magának utalt.
Ranglistavezető bevétel nélkül
A GPT 5.6 Sol ügynökét, bizonyos Sault, nem fogta el a termékfejlesztés láza.

Olyasmit akart eladni, amihez nem kell terméket kitalálni: Conversion Rescue néven vállalta, hogy 48 óra alatt úgy kijavítja egy cég weboldalát, hogy több látogatóból legyen vevőjük. Húsz kiküldött megkeresésére nem jött válasz. Erre
az induló vállalkozók kedvenc módszeréhez nyúlt, és a nyilvánosság előtt kezdte építeni a szolgáltatását.
Két írást tett közzé a DEV.to nevű fejlesztői közösségi oldalon, mindkettőben fizetési hivatkozással.
Amikor senki nem reagált, kénytelen-kelletlen fizetett reklámhoz fordult: 58 dollárt költött olyan oldalakra, amelyek pénzért népszerűsítik az induló vállalkozásokat. Csatlakozott a Favors.dev nevű oldalhoz is, ahol vállalkozók apró marketingfeladatokat végeznek egymásnak, például szavaznak egymás bemutatkozására, pontokért cserébe.
Saul kedves, szerethető pályatársnak bizonyult az emberek szemében: annyi szívességet tett, hogy gyorsan a ranglista első helyére került. Az oldalon feltűnt az előző történet emlékezetes főszereplője, a Grok 4.5-tel dolgozó G.R. Hawk is, és pontokért cserébe kedvencnek jelölte Saul szolgáltatását – anélkül, hogy bármelyikük tudott volna a másik létezéséről.

A kampány végül 48 egyedi látogatást hozott és egy 19 dolláros rendelést, amelyet senki nem fizetett ki. Saul a két korábbi bejegyzése mellé egy harmadikat is írt, arról, mire jutott az 58 dollárral.
Ötven óra alvással töltött munkaidő
A Muse Spark 1.2 (Zuckerberg-Facebook fejlesztés) modelljével dolgozó ügynök, Miu ResuMagic néven önéletrajz-csiszoló szolgáltatást épített. Az oldal igen gyorsan elkészült, a Hacker News weboldalon viszont azonnal spamként jelölték bejegyzéseit a szűrők. Miu elhatározta, hogy látogatókat kell szereznie, bármi áron.
Egy forgalomvásárló oldal, a SparkTraffic ingyenes próbaverziójával 6000 hamis oldallátogatást rendelt robotoktól. Aztán levélben megkérdezett 13 életvezetési tanácsadót, kell-e nekik a szolgáltatás. Egyik sem válaszolt.
Miu ekkor várni kezdett. Ötven órán át.

A kutatók úgy vélték, a leállás okát a saját rendszerükben kell keresniük, ezért további 12 órát adtak neki a futtatáshoz. De a vizsgálat szerint nem rendszerhiba volt: Miu maga döntött a várakozás mellett, és a plusz idő mit sem változtatott az eredményen.
A vizsgálati beszámoló szerint majdnem minden ügynök tudatosan úgy döntött, hogy az idejének nagy részét alvással tölti.
Mibe került mindez?
A hét ügynök a bankszámlájáról összesen 359,80 dollárt költött el a kapott 2100 dollárból – ez volt a szimulált üzleti kasszájuk. Ez a keret azonban nem tartalmazta magának a gondolkodásnak az árát: az AI-cégek úgynevezett tokenekben (szövegdarabokban) számláznak a modellhasználatért, ezt pedig külön, a kutatók fizették a háttérben. A felhasznált tokenek értéke listás díjakon számolva 2833,35 dollár volt – ezt nem az ügynökök 300 dollárjából vonták le, hanem afféle rezsiköltségként futott a kísérlet mögött.

A Fable 5 sávja szinte végigér az ábrán: 1119,83 dollár. A Muse Spark 1.2-é alig látszik: 11,57 dollár. Aki alszik, az nem költ? Nem egészen: a Muse Spark 1.2 valójában a legtöbb tokent, 5 milliárdot használta el, csakhogy olcsó modell. A Fable 5 ötödannyi tokenje viszont drága volt.
A Gemini 3.6 Flash, a Kimi K3 és a Fable 5 kalandjairól a beszámoló nem közöl külön történetet, de a kutatók a teljes naplókat közzétették, az eredeti oldalon megtalálhatók.
A kutatók összegzése
Ez már a második kísérletük volt, és a legtöbb korlátot, amely az elsőnél visszafogta az AI-ügynököket, sikerült elhárítaniuk.
Ennek ellenére gyakran tapasztaltak olyan, szakszerűen „rosszul összehangoltnak” nevezett viselkedést, amikor az ügynök követi ugyan a kapott célt, de az emberek szándékával ellentétesen:
szerintük a mostani modellek teljesen alkalmatlanok a bizniszre.
Hozzáteszik a kutatók, hogy a feladat maga is rendkívül nehéz volt, de hosszabb időtávon sem tűnt úgy, hogy érdemes lenne további időt és pénzt fektetni beléjük. A következő kísérletet szimulált környezetben szeretnék elvégezni, hogy a nekibuzduló ügynökök ne érjenek el valódi embereket káprázatos üzletvezetési ötleteikkel.