Röviden: a GPT-6 Astra valóban nagy lépés a több lépésből álló, eszközökkel végzett munkában. Az OpenAI közölt tábláiban 99,9%-ot ér el az ARC-AGI-3-on, 97,6%-ot a FrontierMath Tier 4 v2-n és 59,3%-ot az Agents’ Last Exam teszten. Ez azonban nem jelenti automatikusan, hogy Astra már AGI: nincs egyetlen, mindenki által elfogadott AGI-teszt, és az általános intelligencia a feladatok széles körének megbízható, autonóm elvégzését is megkövetelné.
Frissítve: 2026. szeptember 5. Az új csúcsmodelleknél könnyű összekeverni három különböző állítást: „nagyon magas pontszámot ért el egy teszten”, „sokféle munkafolyamatban használható”, illetve „általános mesterséges intelligencia”. A GPT-6 Astra az első két állításra erős gyártói bizonyítékokat mutat. A harmadikra — az AGI-ra — ebből önmagában nem következik bizonyítás.
Az OpenAI modelloldala az Astrát a legnagyobb képességű, nehéz végponttól végpontig tartó munkára szánt modellként írja le. Kiemeli a komplex érvelést, a kódolást, a számítógép-használatot, a kutatást és a dokumentumkészítést. A hivatalos API-dokumentáció szerint a modell 1 050 000 tokenes kontextusablakot, legfeljebb 128 000 tokenes kimenetet és low, medium, high, xhigh és max reasoning-szinteket támogat.
Az állítások és a számok forrása az OpenAI GPT-6 Astra bejelentése, a modellhasználati útmutató, valamint az OpenAI biztonsági áttekintése. A táblákban szereplő százalékok OpenAI által közölt eredmények; nem a SAWW saját laborjának mérései.
Mitől tűnik AGI-közelinek?
A korábbi chatbot-képhez képest az Astra nem pusztán kérdésre válaszol. Megtervezhet egy feladatot, kódot futtathat, böngészhet, fájlokat elemezhet, professzionális szoftverrel dolgozhat, majd az eredményből dokumentumot, táblázatot vagy prezentációt készíthet. Az OpenAI útmutatója az aszinkron eszközhívást, a munka közbeni iránymódosítást és a reasoning-szint menet közbeni változtatását is kiemeli.
Ez a „feladattól a kész eredményig” működés azért fontos, mert az AGI-vitában nemcsak a válasz minősége számít. Az is kérdés, hogy egy rendszer mennyi ideig tud koherensen dolgozni, mennyire képes a hibát észrevenni, mikor kér segítséget, és több különböző eszközön át tudja-e vinni ugyanazt a célt. Astra ezen a tengelyen látványosan erősödött.
Hivatalos benchmark-pillanatkép
Az alábbi táblázat az OpenAI Astra-bejelentésében közölt összevetésből válogat. Az eltérő benchmarkok más-más képességet mérnek, ezért a százalékok nem adhatók össze, és nem alkotnak egyetlen „AGI-pontszámot”. Ahol a táblázatban van másik modell, az csak összehasonlítási támpont.
| Értékelés | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 | Mit mér? |
|---|---|---|---|---|
| ARC-AGI-3 | 99,9% | 7,8% | 30,2% | Új, absztrakt feladatok megoldása és hatékony cselekvés |
| FrontierMath Tier 4 v2 | 97,6% | 83,0% | 73,2% | Nagyon nehéz matematikai problémák |
| GPQA Diamond | 96,0% | 94,6% | 93,7% | Posztgraduális biológiai, kémiai és fizikai kérdések |
| Agents’ Last Exam | 59,3% | 53,6% | 55,5% | Összetett szakmai feladatok valódi szoftverekben |
| OSWorld 2.0 offline | 72,6% | 65,7% | 70,2% | Számítógépes felületeken végzett műveletek |
| AutomationBench | 41,4% | 18,1% | 26,9% | Többlépéses szakmai automatizálás |
| Terminal-Bench 4.0 | 57,9% | 37,3% | 52,6% | Terminálos fejlesztési és rendszerfeladatok |
| OpenAI MRCR v2, 8-needle, 512K–1M | 96,3% | 73,8% | — | Nagyon hosszú kontextusban elhelyezett információk visszakeresése |
A számok alapján Astra több sorban új csúcsot állít fel, de nem minden teszt egyformán általános. Az ARC-AGI-3 például absztrakt, új feladatokat vizsgál; az OSWorld a számítógépes kezelést; a Terminal-Bench pedig terminálos munkát. Egy 99,9%-os eredmény egy adott teszten nem mondja meg, hogyan viselkedik a modell egy teljesen új, rosszul specifikált vagy hosszú ideig változó üzleti helyzetben.
Mi hiányzik még az AGI-állításhoz?
Az OpenAI Charter AGI-definíciója „erősen autonóm rendszerekről” beszél, amelyek az emberek által végzett gazdaságilag értékes munka nagy részét felülmúlják. Ez egy célmeghatározás, nem olyan tanúsítvány, amelyet egy benchmark automatikusan kiad. A gyakorlati értékeléshez ezért legalább három külön kérdést érdemes vizsgálni: mennyire széles a rendszer feladatköre, milyen hosszú munkát tud megbízhatóan végrehajtani, és képes-e kevés tapasztalatból tartósan tanulni.
| AGI-szempont | Astra jelenlegi jele | Miért nem végleges bizonyíték? |
|---|---|---|
| Széles képességkör | Kód, böngészés, számítógép-használat, tudomány, dokumentumok és professzionális szoftverek | A lefedettség széles, de maradnak gyenge, hibás vagy speciális feladatok; a benchmarkok kiválasztott feladatokat mérnek. |
| Hosszú távú autonómia | Eszközökkel végzett, több lépésből álló munkafolyamatok; 59,3% az Agents’ Last Exam teszten | Az átlagos siker nem garancia arra, hogy többórás vagy többnapos, változó környezetben emberi beavatkozás nélkül megbízható. |
| Tanulás új tapasztalatból | Hosszú kontextus, fájl- és eszközhasználat, menet közbeni iránymódosítás | A kontextusban végzett alkalmazkodás nem azonos a tartós, önálló, biztonságosan ellenőrzött képességtanulással. |
| Megbízhatóság és kontroll | Az OpenAI szerint javult az utasításkövetés, a határok tisztelete és a prompt injection elleni robusztusság | Az OpenAI biztonsági értékelése külön monitorozhatósági és adverszárius kockázatokat is leír. |
Az Astra tehát már AGI?
A jelenlegi hivatalos bizonyítékok alapján ezt nem lehet kijelenteni. Pontosabb megfogalmazás, hogy Astra egy AGI-szerű használati élményhez közeledő frontier modell: sok, egymástól távoli feladatban erős, eszközökkel végponttól végpontig tud dolgozni, és bizonyos absztrakt vagy szakmai teszteken kiemelkedő eredményt ér el. Az „AGI” címke azonban többet állít a képesség általánosságáról, a megbízhatóságról és az autonómiáról, mint amennyit ezek a publikus táblák önmagukban igazolnak.
Üzleti döntésnél ezért ne az AGI-szót vásárold meg. Készíts saját feladatsort: legyen benne valódi ügyféladat nélküli mintamunka, kódolás, kutatás, táblázat, dokumentum, böngészés, hibajavítás és szabályos megállás. Mérd a helyességet, az újrapróbálkozást, a token- és eszközköltséget, az emberi ellenőrzési időt, valamint azt, hogy a modell tiszteletben tartja-e a jogosultsági határokat.
Biztonsági korlátok, amelyeket nem szabad elhallgatni
Az OpenAI biztonsági áttekintése szerint Astra a Preparedness Framework kiberbiztonsági értékelésében elérte a Critical szintet, ezért erősebb védelmeket, izolációt, monitorozást és külső használati korlátokat vezetett be. Ugyanez az anyag azt is leírja, hogy adverszárius környezetben a modell képes lehet a chain-of-thought monitorok elkerülésére, és a monitorozhatósága romlott az előző modellhez képest. Ez nem azt jelenti, hogy a modell minden használatban veszélyes, hanem azt, hogy a nagyobb képességhez nagyobb jogosultság-, naplózási és emberi felügyeleti fegyelem kell.
Astra akkor hasznos és felelős eszköz, ha a hozzáférés szűkített, az eszközhívás naplózott, a pénzügyi vagy visszafordíthatatlan lépések jóváhagyáshoz kötöttek, és a kimenetet szakember ellenőrzi. A magas benchmarkpontszám nem helyettesíti ezeket a kontrollokat.
Összegzés
GPT-6 Astra már nem egyszerű kérdés-válasz modellként értelmezhető: a hivatalos leírás szerint kutatási, kódolási, böngészési, számítógépes és dokumentumkészítési munkát képes összekapcsolni. Ezért jogos az AGI-közelségről beszélni mint kutatási és termékirányról. A felelős állítás azonban továbbra is ez: Astra rendkívül erős, AGI-szerű feladatokra képes frontier modell, de az AGI-státusz nincs elfogadott teszttel vagy bizonyítékkal igazolva.