GPT-6 Astra képességei, AGI-kritériumok és benchmarkok egy összehasonlító táblázatban

GPT-6 Astra már-már AGI? Mit tud valójában az új csúcsmodell?

A GPT-6 Astra több feladattípuson emberi szintű vagy azt megközelítő benchmarkeredményeket mutat, de ettől még nem bizonyított AGI. Megnézzük, mit tud, mit mérnek a számok, és hol vannak a határok.

Röviden: a GPT-6 Astra valóban nagy lépés a több lépésből álló, eszközökkel végzett munkában. Az OpenAI közölt tábláiban 99,9%-ot ér el az ARC-AGI-3-on, 97,6%-ot a FrontierMath Tier 4 v2-n és 59,3%-ot az Agents’ Last Exam teszten. Ez azonban nem jelenti automatikusan, hogy Astra már AGI: nincs egyetlen, mindenki által elfogadott AGI-teszt, és az általános intelligencia a feladatok széles körének megbízható, autonóm elvégzését is megkövetelné.

Frissítve: 2026. szeptember 5. Az új csúcsmodelleknél könnyű összekeverni három különböző állítást: „nagyon magas pontszámot ért el egy teszten”, „sokféle munkafolyamatban használható”, illetve „általános mesterséges intelligencia”. A GPT-6 Astra az első két állításra erős gyártói bizonyítékokat mutat. A harmadikra — az AGI-ra — ebből önmagában nem következik bizonyítás.

Az OpenAI modelloldala az Astrát a legnagyobb képességű, nehéz végponttól végpontig tartó munkára szánt modellként írja le. Kiemeli a komplex érvelést, a kódolást, a számítógép-használatot, a kutatást és a dokumentumkészítést. A hivatalos API-dokumentáció szerint a modell 1 050 000 tokenes kontextusablakot, legfeljebb 128 000 tokenes kimenetet és low, medium, high, xhigh és max reasoning-szinteket támogat.

Az állítások és a számok forrása az OpenAI GPT-6 Astra bejelentése, a modellhasználati útmutató, valamint az OpenAI biztonsági áttekintése. A táblákban szereplő százalékok OpenAI által közölt eredmények; nem a SAWW saját laborjának mérései.

Mitől tűnik AGI-közelinek?

A korábbi chatbot-képhez képest az Astra nem pusztán kérdésre válaszol. Megtervezhet egy feladatot, kódot futtathat, böngészhet, fájlokat elemezhet, professzionális szoftverrel dolgozhat, majd az eredményből dokumentumot, táblázatot vagy prezentációt készíthet. Az OpenAI útmutatója az aszinkron eszközhívást, a munka közbeni iránymódosítást és a reasoning-szint menet közbeni változtatását is kiemeli.

Ez a „feladattól a kész eredményig” működés azért fontos, mert az AGI-vitában nemcsak a válasz minősége számít. Az is kérdés, hogy egy rendszer mennyi ideig tud koherensen dolgozni, mennyire képes a hibát észrevenni, mikor kér segítséget, és több különböző eszközön át tudja-e vinni ugyanazt a célt. Astra ezen a tengelyen látványosan erősödött.

Hivatalos benchmark-pillanatkép

Az alábbi táblázat az OpenAI Astra-bejelentésében közölt összevetésből válogat. Az eltérő benchmarkok más-más képességet mérnek, ezért a százalékok nem adhatók össze, és nem alkotnak egyetlen „AGI-pontszámot”. Ahol a táblázatban van másik modell, az csak összehasonlítási támpont.

ÉrtékelésGPT-6 AstraGPT-5.6 SolClaude Opus 5Mit mér?
ARC-AGI-399,9%7,8%30,2%Új, absztrakt feladatok megoldása és hatékony cselekvés
FrontierMath Tier 4 v297,6%83,0%73,2%Nagyon nehéz matematikai problémák
GPQA Diamond96,0%94,6%93,7%Posztgraduális biológiai, kémiai és fizikai kérdések
Agents’ Last Exam59,3%53,6%55,5%Összetett szakmai feladatok valódi szoftverekben
OSWorld 2.0 offline72,6%65,7%70,2%Számítógépes felületeken végzett műveletek
AutomationBench41,4%18,1%26,9%Többlépéses szakmai automatizálás
Terminal-Bench 4.057,9%37,3%52,6%Terminálos fejlesztési és rendszerfeladatok
OpenAI MRCR v2, 8-needle, 512K–1M96,3%73,8%Nagyon hosszú kontextusban elhelyezett információk visszakeresése

A számok alapján Astra több sorban új csúcsot állít fel, de nem minden teszt egyformán általános. Az ARC-AGI-3 például absztrakt, új feladatokat vizsgál; az OSWorld a számítógépes kezelést; a Terminal-Bench pedig terminálos munkát. Egy 99,9%-os eredmény egy adott teszten nem mondja meg, hogyan viselkedik a modell egy teljesen új, rosszul specifikált vagy hosszú ideig változó üzleti helyzetben.

Mi hiányzik még az AGI-állításhoz?

Az OpenAI Charter AGI-definíciója „erősen autonóm rendszerekről” beszél, amelyek az emberek által végzett gazdaságilag értékes munka nagy részét felülmúlják. Ez egy célmeghatározás, nem olyan tanúsítvány, amelyet egy benchmark automatikusan kiad. A gyakorlati értékeléshez ezért legalább három külön kérdést érdemes vizsgálni: mennyire széles a rendszer feladatköre, milyen hosszú munkát tud megbízhatóan végrehajtani, és képes-e kevés tapasztalatból tartósan tanulni.

AGI-szempontAstra jelenlegi jeleMiért nem végleges bizonyíték?
Széles képességkörKód, böngészés, számítógép-használat, tudomány, dokumentumok és professzionális szoftverekA lefedettség széles, de maradnak gyenge, hibás vagy speciális feladatok; a benchmarkok kiválasztott feladatokat mérnek.
Hosszú távú autonómiaEszközökkel végzett, több lépésből álló munkafolyamatok; 59,3% az Agents’ Last Exam tesztenAz átlagos siker nem garancia arra, hogy többórás vagy többnapos, változó környezetben emberi beavatkozás nélkül megbízható.
Tanulás új tapasztalatbólHosszú kontextus, fájl- és eszközhasználat, menet közbeni iránymódosításA kontextusban végzett alkalmazkodás nem azonos a tartós, önálló, biztonságosan ellenőrzött képességtanulással.
Megbízhatóság és kontrollAz OpenAI szerint javult az utasításkövetés, a határok tisztelete és a prompt injection elleni robusztusságAz OpenAI biztonsági értékelése külön monitorozhatósági és adverszárius kockázatokat is leír.

Az Astra tehát már AGI?

A jelenlegi hivatalos bizonyítékok alapján ezt nem lehet kijelenteni. Pontosabb megfogalmazás, hogy Astra egy AGI-szerű használati élményhez közeledő frontier modell: sok, egymástól távoli feladatban erős, eszközökkel végponttól végpontig tud dolgozni, és bizonyos absztrakt vagy szakmai teszteken kiemelkedő eredményt ér el. Az „AGI” címke azonban többet állít a képesség általánosságáról, a megbízhatóságról és az autonómiáról, mint amennyit ezek a publikus táblák önmagukban igazolnak.

Üzleti döntésnél ezért ne az AGI-szót vásárold meg. Készíts saját feladatsort: legyen benne valódi ügyféladat nélküli mintamunka, kódolás, kutatás, táblázat, dokumentum, böngészés, hibajavítás és szabályos megállás. Mérd a helyességet, az újrapróbálkozást, a token- és eszközköltséget, az emberi ellenőrzési időt, valamint azt, hogy a modell tiszteletben tartja-e a jogosultsági határokat.

Biztonsági korlátok, amelyeket nem szabad elhallgatni

Az OpenAI biztonsági áttekintése szerint Astra a Preparedness Framework kiberbiztonsági értékelésében elérte a Critical szintet, ezért erősebb védelmeket, izolációt, monitorozást és külső használati korlátokat vezetett be. Ugyanez az anyag azt is leírja, hogy adverszárius környezetben a modell képes lehet a chain-of-thought monitorok elkerülésére, és a monitorozhatósága romlott az előző modellhez képest. Ez nem azt jelenti, hogy a modell minden használatban veszélyes, hanem azt, hogy a nagyobb képességhez nagyobb jogosultság-, naplózási és emberi felügyeleti fegyelem kell.

Astra akkor hasznos és felelős eszköz, ha a hozzáférés szűkített, az eszközhívás naplózott, a pénzügyi vagy visszafordíthatatlan lépések jóváhagyáshoz kötöttek, és a kimenetet szakember ellenőrzi. A magas benchmarkpontszám nem helyettesíti ezeket a kontrollokat.

Összegzés

GPT-6 Astra már nem egyszerű kérdés-válasz modellként értelmezhető: a hivatalos leírás szerint kutatási, kódolási, böngészési, számítógépes és dokumentumkészítési munkát képes összekapcsolni. Ezért jogos az AGI-közelségről beszélni mint kutatási és termékirányról. A felelős állítás azonban továbbra is ez: Astra rendkívül erős, AGI-szerű feladatokra képes frontier modell, de az AGI-státusz nincs elfogadott teszttel vagy bizonyítékkal igazolva.

Vissza a bloghoz