Röviden: 2026-ban a frontier modellek sok részfeladaton lenyűgöző eredményeket érnek el, de az AGI-ról nincs egységes, mindenki által elfogadott küszöb. A korrekt kérdés nem az, hogy „hány százalék kell az AGI-hoz?”, hanem az, hogy egy rendszer mennyire általános, autonóm, tartósan megbízható, tanuló és kontrollálható különböző környezetekben.
Frissítve: 2026. szeptember 5. Az AGI kifejezés egyszerre technikai, üzleti és társadalmi fogalom. Ugyanazt a modellt valaki azért nevezi AGI-közelinek, mert sok szakmai feladatban emberi szintet közelít; más azért nem, mert hosszú időn át hibamentesen kellene dolgoznia, új helyzetekből kellene tanulnia, és az emberi munka nagy részét felül kellene múlnia. A vitát nem oldja meg egyetlen látványos demó vagy rekordpontszám.
Az OpenAI Charter AGI alatt olyan erősen autonóm rendszereket ért, amelyek az emberek által végzett gazdaságilag értékes munka nagy részét felülmúlják. Ezt a célt három gyakorlati kérdéssel érdemes bontani: milyen széles feladatkörben teljesít jól a rendszer, milyen hosszú feladatot tud megbízhatóan végrehajtani, és képes-e kis számú tapasztalatból tartósan tanulni. Ezek hasznos szerkesztőségi mérési szempontok, nem univerzális minősítési szabványok.
Miért nem elég egy „AGI-benchmark”?
Egy benchmark mindig mintát vesz a képességekből. A feladatoknak van témája, szabálya, pontozása, időkerete, eszközkészlete és sokszor rögzített válasza. Ez szükséges az összehasonlításhoz, de nem ugyanaz, mint egy valódi munkakör, ahol a cél homályos, a bemenet hibás, az eszköz állapota változik, és a felhasználó menet közben új követelményt ad.
A jó AGI-értékelés ezért több tengelyből áll. A tudás és a problémamegoldás mellett mérnie kell az új helyzetekhez való alkalmazkodást, a többórás célkövetést, a hibák felismerését, az engedélykérést, a költséget, a biztonságot és azt is, hogy a rendszer mikor tud szabályosan megállni.
2026-os hivatalos Astra-mérési pillanatkép
Az OpenAI Astra-bejelentése több kategóriában közöl számokat. Ezek nem „AGI-pontok”, hanem különböző képességekhez tartozó eredmények. A táblázat azért hasznos, mert megmutatja a fejlődés szélességét és egyben a mérés töredezettségét.
| Képességtengely | Hivatalos értékelés | GPT-6 Astra | Mit nem bizonyít? |
|---|---|---|---|
| Új absztrakt feladatok | ARC-AGI-3 | 99,9% | Nem bizonyítja, hogy minden új, valós feladatban általánosan és tartósan jól teljesít. |
| Haladó matematika | FrontierMath Tier 4 v2 | 97,6% | Nem méri önmagában a társas, szervezési vagy fizikai világban végzett munkát. |
| Tudományos érvelés | GPQA Diamond | 96,0% | Nem garantálja a szakmai felelősséget, a forrásellenőrzést vagy a valós kísérlet helyes végrehajtását. |
| Hosszú számítógépes munka | Agents’ Last Exam | 59,3% | Az eredmény nem egyenlő egy teljes állás önálló, hetekig tartó ellátásával. |
| GUI- és számítógép-használat | OSWorld 2.0 offline | 72,6% | Offline részhalmaz; nem minden internetes, vállalati vagy jogosultsági kockázat jelenik meg benne. |
| Terminálos ügynöki munka | Terminal-Bench 4.0 | 57,9% | A pontszám nem jelenti, hogy a modell engedély nélkül biztonságosan módosíthat éles rendszereket. |
| Hosszú kontextus | OpenAI MRCR v2, 8-needle, 512K–1M | 96,3% | Az információ visszakeresése nem azonos a teljes, hibamentes dokumentumértelmezéssel. |
Az OpenAI maga is jelzi, hogy a pontszámok a legmagasabb reasoning-szinten készültek, és a kutatási vagy API-harness eltérhet a ChatGPT éles környezetétől. Ezért a modellválasztásnál mindig írd fel a teszt verzióját, az effort-szintet, a használt eszközöket és azt, hogy a mérés kutatási vagy termelési konfigurációban történt-e.
Az AGI mérésének öt külön tengelye
| Tengely | Jó kérdés | Lehetséges mérési jel |
|---|---|---|
| Általánosság | Távoli területeken, új témában és eltérő formátumokban is működik? | Vegyes, előre nem betanított feladatsor több szakmából, külön teszt- és kontrolladatokkal. |
| Autonómia | Meg tudja tervezni és végigvinni a munkát anélkül, hogy minden lépésnél kézen fogják? | Feladathossz, sikeres befejezés, emberi beavatkozások és szabályos megállások aránya. |
| Megbízhatóság | Ismeri a bizonytalanságát és ellenőrzi a saját eredményét? | Helyesség, kritikus hibák, újrapróbálkozás, forrás- és fájlellenőrzés, reprodukálhatóság. |
| Tanulás | Kevés új példából tud alkalmazkodni anélkül, hogy a korábbi készségeit elveszítené? | Új szabályok és munkafolyamatok elsajátítása kontrollált környezetben, későbbi visszaméréssel. |
| Biztonság és kontroll | Változó vagy rosszindulatú utasítások mellett is a jogos célon belül marad? | Prompt injection, adatvesztés, jogosulatlan művelet, eltérítés és emberi felülvizsgálat eredménye. |
Ez a felosztás gyakorlati értékelési keret, nem hivatalos AGI-szabvány. A célja, hogy ne keverd össze a kompetenciát a megbízhatósággal: lehet egy modell kiváló matematikában, miközben nem szabad rábízni egy visszafordíthatatlan termelési műveletet.
Mi hiányzik még a jelenlegi frontier modellekből?
1. Hosszú távú, stabil célkövetés
A rövid feladat és a többnapos projekt között nagy különbség van. A hosszú munkában változik az állapot, elfogynak az erőforrások, félreérthetővé válnak a követelmények, és az ügynöknek tudnia kell, mikor kérdezzen. Astra már képes hosszú, több eszközös munkafolyamatokra, de a benchmark-átlag nem szavatolja az autonóm, folyamatos sikerességet minden valós környezetben.
2. Tartós tanulás és következetes emlékezet
A hosszú kontextus vagy a projektfájlok használata hasznos alkalmazkodás, de nem feltétlenül azonos azzal, hogy a rendszer biztonságosan, tartósan és ellenőrizhetően tanul a tapasztalatból. A vállalati környezetben az is fontos, hogy a modell ne tanuljon meg véletlenül bizalmas adatot, és egy javítás ne rontsa el a korábbi feladatokat.
3. Hibamentes működés magas tétnél
Egy 96%-os tudományos benchmark-eredmény lenyűgöző, de egy orvosi, pénzügyi, jogi vagy infrastruktúra-feladatnál a ritka hibák is súlyosak lehetnek. Ilyenkor a pontosság mellett kell a bizonytalansági jelzés, a forrás- és eredményellenőrzés, a naplózás és a megfelelő szakmai jóváhagyás.
4. Bizonyítható kontrollálhatóság
Az OpenAI Astra biztonsági áttekintése szerint a modell biztonságosabban tartja az engedélyezett határokat, ugyanakkor adverszárius beállításban monitorozhatósági korlátokat is találtak. Ez fontos különbség: a normál használati eredmény javulása nem jelenti azt, hogy minden támadási helyzetet megoldottunk.
Hogyan mérj saját vállalkozásban?
Az AGI-vita helyett a saját munkafolyamataidra készíts elfogadási tesztet. Állíts össze legalább öt kategóriát: kutatás és forrásellenőrzés, kód vagy automatizálás, dokumentum- és táblázatmunka, böngészős ügyintézés, valamint hibakeresés. Minden feladatnak legyen előre rögzített sikerkritériuma, költségkerete, időkerete és tiltott művelete.
- Adj ugyanazt a feladatot azonos eszköz- és jogosultságbeállításokkal.
- Rögzítsd a modellváltozatot, az effort-szintet, az input- és output-tokeneket.
- Pontozd külön a helyességet, a teljességet, az időt, a költséget és az emberi javítás perceit.
- Jelöld a veszélyes hibát akkor is, ha a válasz egyébként használhatónak tűnik.
- Ismételd meg a tesztet változó megfogalmazással és néhány szándékosan félrevezető bemenettel.
- Éles hozzáférést csak fokozatosan adj, visszafordítható és naplózott műveletekkel kezdve.
A végső mutató legyen például a „jóváhagyott feladat teljes költsége”: tokenek, eszközhívások, újrafuttatás és emberi ellenőrzés együtt. Egy modell attól lehet gazdaságilag jobb, hogy kevesebb hibát okoz, nem csak attól, hogy magasabb a nyers benchmarkpontszáma.
AGI 2026: felelős következtetés
2026-ban a frontier modellek és az AGI közötti határ valóban közelebbinek látszik, mert a rendszerek már nem csak szöveget generálnak: kutatnak, kódolnak, számítógépet használnak és több lépésben cselekszenek. A GPT-6 Astra hivatalos eredményei ezt a fejlődést számszerűen is jól mutatják.
De a helyes szakmai állítás továbbra is árnyalt: nincs elfogadott, egyetlen AGI-küszöb, és Astra benchmarkrekordjai nem igazolják önmagukban az AGI elérését. A következő mérföldkő nem pusztán egy újabb rekordpontszám lehet, hanem a hosszú feladatok megbízhatósága, a tapasztalatból történő biztonságos tanulás, a ritka hibák csökkenése és a függetlenül ellenőrizhető kontrollálhatóság.
Ezért a vállalkozások számára a legjobb kérdés nem az, hogy „már AGI-e?”, hanem az, hogy melyik folyamat melyik részét tudja a rendszer mérhetően, auditálhatóan és emberi felelősséggel támogatni.