We wpisach z 14 września Elon Musk przedstawił ambitną, ale nadal nieweryfikowalną publicznie ścieżkę rozwoju modeli xAI. Według tej zapowiedzi Grok 4.8 — model o 2,5 bln parametrów — miał zakończyć trening wstępny w tym tygodniu, a następnie rozpocząć uczenie ze wzmocnieniem (RL). Na pytanie o AGI, czyli sztuczną inteligencję ogólną, Musk wskazał nie Groka 4.8, lecz Groka 5.
1
2
To jednak prognoza założyciela firmy, nie potwierdzony wynik. Nie opublikowano benchmarków, karty modelu, definicji AGI, kryteriów oceny ani daty udostępnienia tych modeli.
2
4
Co zapowiedziano o Groku 4.8, 4.9 i 5
Musk określił Groka 4.8 jako model o 2,5 bln parametrów, trenowany na nowym stosie oprogramowania xAI w C++. Po ukończeniu treningu wstępnego miał wejść w etap RL, czyli dostrajania zachowania modelu na podstawie informacji zwrotnej i mechanizmów nagradzania.
1
2
Jednocześnie przedstawił kolejne modele jako kolejne szczeble rozwoju po Groku 4.7:
- Grok 4.8: „zauważalna poprawa” względem 4.7;
- Grok 4.9: prawdopodobnie klasa Astra lub Fable;
- Grok 5: „może lepszy niż wszystko inne”; właśnie ten model Musk wskazał w odpowiedzi dotyczącej AGI.
2
14
Sformułowanie „może lepszy niż wszystko inne” nie jest mierzalną deklaracją przewagi. Nie wiadomo też, jakie zdolności, poziom niezawodności, samodzielności, bezpieczeństwa czy wyniki testów xAI uznałoby za spełniające warunek AGI.
2
10
Grok 4.7: ostrożniejsze porównanie i opóźnienie
W przypadku bliższego premiery Groka 4.7 Musk był wyraźnie bardziej powściągliwy. Ocenił, że model powinien być „mniej więcej na poziomie Opus 5.0, nie 5.1”: lepszy w części zastosowań, słabszy w innych. Przyznał też, że xAI musi poprawić jego możliwości multimodalne, czyli pracę z więcej niż jednym typem danych, np. tekstem i obrazem.
3
8
To istotnie węższa deklaracja niż ogłoszenie ogólnego przywództwa technologicznego. Co więcej, plan dla wersji 4.8, 4.9 i 5 omawiano, zanim deweloperzy otrzymali publicznie dostępnego Groka 4.7 do niezależnej oceny.
2 września Musk mówił, że Grok 4.7 pojawi się za około 10 dni, co wskazywało na okolice 12 września. 11 września przyznał jednak, że potrzeba jeszcze „kilku dni”.
7
20
Jako możliwą przyczynę podał problem z dostrajaniem RL: xAI mogło zbyt mocno karać model za długie odpowiedzi. W efekcie Grok mógł przedwcześnie porzucać trudne zadania, które był w stanie rozwiązać, oraz zbyt słabo weryfikować własne odpowiedzi. Musk przedstawił to jako hipotezę, a nie zakończoną diagnozę techniczną.
20
21
Co było dostępne publicznie
Na 14 września Grok 4.7 nie był jeszcze publicznie wydany. Najnowszym udokumentowanym flagowym modelem xAI pozostawał Grok 4.6, wydany 12 sierpnia. Wskazywane ceny API wynosiły 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych.
3
11
W tym samym okresie jako wrześniowe premiery lub ogłoszone oferty wskazywano Claude Fable 5.1, Gemini 3.8 Flash i GPT-6 Astra.
34
45 Kontekst konkurencyjny zwiększa znaczenie zapowiedzi xAI, ale nie stanowi dowodu porównywalnej jakości niewydanych modeli Grok.
Liczba parametrów nie dowodzi AGI
Skala 2,5 bln parametrów i nowy stos treningowy mogą świadczyć o dużych inwestycjach infrastrukturalnych. Nie dowodzą jednak samodzielnie zdolności modelu, jego niezawodności ani osiągnięcia AGI. Opóźnienie Groka 4.7 jest praktycznym przykładem: po zakończeniu treningu wstępnego nadal kluczowe mogą być zachowanie po dostrojeniu RL, testy, jakość multimodalna, bezpieczeństwo, gotowość wdrożeniowa oraz model cenowy.
1
20
Dla deweloperów, klientów i inwestorów bardziej użyteczne od języka roadmapy będą cztery konkretne sygnały:
- Oficjalna premiera i rzeczywista dostępność modelu lub produktu.
- Cennik, dokumentacja oraz karta modelu.
- Odtwarzalne wyniki benchmarków, w tym — gdy ma to znaczenie — testy multimodalne i zadania wymagające długiego planowania.
- Jasna definicja AGI oraz standard oceny, zanim deklarację AGI potraktuje się jako coś więcej niż ambitną zapowiedź.
Na razie wypowiedzi Muska z 14 września wyznaczają zamierzony kierunek xAI: Grok 4.8 po treningu wstępnym i RL, mocniejszy 4.9 oraz wyjątkowo ambitny Grok 5. Nie potwierdzają natomiast, że którykolwiek z tych modeli osiągnął zapowiadany poziom możliwości.
2
4