Röviden: a Grok 4.6 ugyanazon normál bemeneti és kimeneti listaárral, de több közölt benchmarkon érdemi javulással követi a Grok 4.5-öt. A legnagyobb előny a hosszú ügynöki, terminálos és szakmai feladatoknál látszik. Váltás előtt ellenőrizd a cache-költséget, a promptkompatibilitást és a saját regressziós teszteket.
Frissítve: 2026. szeptember 7. Az xAI a Grok 4.6-ot nem teljesen új termékcsaládként, hanem a 4.5 továbbfejlesztéseként mutatta be. Mindkettő 500 ezres kontextust és 2 USD/millió bemeneti, 6 USD/millió kimeneti normál listaárat kínál 200 ezer token alatti promptnál. A különbség elsősorban a hosszú feladatokon mutatott teljesítmény, az utótréning és a cache ára.
Forrásunk a Grok 4.6 bejelentés, a Grok 4.6 modelloldal és az xAI API-árazása. A benchmarkok xAI által közölt eredmények; éles migráció előtt saját regressziós teszt szükséges.
Mi maradt azonos?
| Szempont | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Kontextusablak | 500 000 token | 500 000 token |
| Rövid bemenet | 2 USD / 1M | 2 USD / 1M |
| Rövid kimenet | 6 USD / 1M | 6 USD / 1M |
| Hosszú bemenet 200K-tól | 4 USD / 1M | 4 USD / 1M |
| Hosszú kimenet 200K-tól | 12 USD / 1M | 12 USD / 1M |
Ez kedvező migrációs alap: nem kell pusztán a normál tokenár miatt új üzleti modellt számolni. A cache-elt bemenet viszont változott. Az xAI árlistája szerint a Grok 4.5 rövid cache-ára 0,30 USD/millió token, a Grok 4.6-é 0,50 USD; hosszú kontextusnál 0,60 helyett 1 USD. Nagyon cache-intenzív rendszernél ezt külön modellezni kell.
Hol javult a közölt eredmény?
| Benchmark | Grok 4.5 High | Grok 4.6 High | Változás |
|---|---|---|---|
| AA Intelligence Index | 56 | 61 | +5 pont |
| GDPVal-AA v2 | 1526 | 1753 | +227 Elo |
| CursorBench v3.2 | 66,7% | 69,9% | +3,2 százalékpont |
| DeepSWE v1.1 | 54% | 65,9% | +11,9 százalékpont |
| FrontierCode v1.1 Extended | 56,6% | 61,3% | +4,7 százalékpont |
| APEX-Agents | 47,1% | 57,5% | +10,4 százalékpont |
| Terminal-Bench v3.0 | 15,7% | 26% | +10,3 százalékpont |
| AA-Briefcase | 1313 | 1577 | +264 Elo |
| Harvey LAB | 12,9% | 15,8% | +2,9 százalékpont |
A nagyobb ugrások a hosszú szoftveres, terminálos és általános ügynöki sorokon jelennek meg, ami összhangban van a modell pozicionálásával. A 26%-os Terminal-Bench eredmény ugyanakkor arra is emlékeztet, hogy a javulás nem jelent hibamentes autonómiát: ne adj korlátlan hozzáférést éles rendszerhez.
Mit jelent ez egy működő integrációban?
Az azonos feladatkör és API-k ellenére egy modellcsere módosíthatja a válasz hosszát, az eszközhívások sorrendjét, a strukturált kimenet határeseteit és a biztonsági elutasításokat. A régi prompt lehet túl részletes vagy éppen kevés az új modellhez. Ne csak azt nézd, hogy a 4.6 „okosabb-e”, hanem azt is, hogy stabilan teljesíti-e a már vállalt szerződést.
- Ellenőrizd a JSON-sémákat és a függvényhívási argumentumokat.
- Futtasd újra a hibás, ritka és többértelmű teszteseteket.
- Mérd a kimeneti tokent, mert azonos listaár mellett is változhat a számla.
- Vizsgáld meg a cache-találatokat és a 200 ezres küszöb átlépését.
- Hasonlítsd össze a teljes futási időt és a megszakadt ügynöki köröket.
Mikor érdemes gyorsan váltani?
Ha a rendszer fejlesztői vagy tudásmunkát végez, a Grok 4.5 gyakran elakad hosszú feladatláncokon, és a cache-felár nem jelentős a teljes költségben, a 4.6 jó jelölt. Ugyanez igaz új projektre: azonos alapáron általában ésszerűbb az újabb modellt tesztelni, majd csak konkrét regresszió esetén visszalépni.
Mikor maradhat a Grok 4.5?
Ha a folyamat rövid, már stabilan tesztelt, erősen cache-elt és a 4.6 nem javítja mérhetően a sikerarányt, a migráció nem sürgős. Szabályozott vagy auditált környezetben a dokumentáció, jóváhagyás és újraminősítés költsége is nagyobb lehet, mint a modell előnye. A váltást ilyenkor tervezett verziófrissítésként kezeld.
Biztonságos migráció hat lépésben
- Készíts pillanatfelvételt a jelenlegi promptokról, beállításokról és eredményekről.
- Futtass legalább 50 valós feladatot mindkét modellen, lehetőleg többször.
- Hasonlítsd össze a helyességet, költséget, időt és emberi javítást.
- Indíts kis forgalmú canary tesztet, visszaállítható modellkapcsolóval.
- Naplózd az eszközhívásokat és a strukturált kimeneti hibákat.
- Csak stabil eredmény után növeld a forgalmat, a 4.5 visszaállítási útját megtartva.
Az új modell teljes képességlistáját a Grok 4.6 bemutató foglalja össze. Ha más szolgáltatót is mérlegelsz, nézd meg a Grok 4.6 vs GPT-5.6 Sol összevetést is.