Frozen v2 to silnik wnioskowania przeznaczony do konkretnego zastosowania (application-specific inference engine), a nie ogólny procesor tensorowy, jakim są jednostki TPU Google'a. TPU to programowalne akceleratory, które za pomocą konfiguracji programowej obsługują szeroką gamę modeli AI . Frozen v2 jest ich przeciwieństwem: specyficzna architektura Gemini – jej warstwy, operatory i przepływ danych – jest trwale zapisywana w krzemie na etapie produkcji, co czyni z niego układ typu „Gemini w chipie”.
| Wymiar | Istniejące TPU (Ironwood, TPU 8i/8t) | Frozen v2 |
|---|---|---|
| Filozofia projektowa | Uniwersalny akcelerator AI; programowalne jednostki macierzowe, elastyczny przepływ danych | ASIC o stałej funkcji; architektura Gemini osadzona w krzemie, nieprogramowalna w terenie |
| Cel wydajnościowy | Dobry do trenowania i wnioskowania dla wielu modeli | 6–10x więcej tokenów na wat niż najnowsze TPU Google'a przy inferencji Gemini |
| Model pamięci | HBM + SRAM dla dynamicznie ładowanych wag modelu | Wagi modelu i ścieżki obliczeniowe wbudowane bezpośrednio w mask ROM / logikę okablowaną |
| Elastyczność | Może uruchamiać dowolny model poprzez rekonfigurację programową | Jeden model (Gemini) – brak możliwości przełączania modeli w czasie rzeczywistym |
Głównym osiągnięciem jest efektywność: według doniesień inżynierowie Google'a szacują, że Frozen v2 może dostarczać 6 do 10 razy więcej tokenów AI na jednostkę zużytej energii niż najnowsze układy TPU .
Zgodnie z raportem The Information i potwierdzającymi go doniesieniami, wdrożenie Frozen v2 planowane jest najwcześniej na 2028 rok . Oznacza to, że układ jest jeszcze kilka lat od produkcji i trafi do użytku dopiero po wdrożeniu i dojrzałości obecnej, ósmej generacji układów TPU (Sunfish i Zebrafish).
Startup Taalas pokazuje dokładnie, co ten kompromis oznacza w praktyce. W lutym 2026 roku Taalas zaprezentował układ HC1, który koduje cały model Llama 3.1 8B – każdy parametr – bezpośrednio w obwodach tranzystorowych chipa za pomocą mask ROM, bez zewnętrznej pamięci HBM do przechowywania wag .
Liczby są oszałamiające:
Wady są równie spektakularne:
Założyciel Taalas opisał architekturę jako połączenie „mask ROM recall fabric” z „SRAM recall fabric”, która przechowuje zarówno model, jak i wykonuje wszystkie operacje pamięci podręcznej KV na chipie, całkowicie eliminując zewnętrzny transfer pamięci . Jest to to samo podstawowe podejście, które zastosuje Frozen v2.
Moc obliczeniowa AI Google'a jest tak przeciążona, że firma zaczęła racjonować dostęp nawet płacącym gigantom. Kilka danych wyjaśnia motywację:
Odmowa Meta (marzec 2026): Google poinformował Meta w marcu 2026 roku, że nie jest w stanie dostarczyć całej mocy obliczeniowej Gemini, którą Meta chciała kupić . Niedobór opóźnił niektóre wewnętrzne projekty AI Meta i zmusił firmę do polecenia inżynierom oszczędzania tokenów AI .
Zaległości w realizacji: Zaległości w zamówieniach Google Cloud prawie się podwoiły, osiągając 462 miliardy dolarów w pierwszym kwartale 2026 roku, co stanowi popyt około 23-krotnie przekraczający dostępną moc przetwarzania . CEO Sundar Pichai potwierdził podczas telekonferencji wynikowej: „Jesteśmy w najbliższym czasie ograniczeni mocą obliczeniową… nasze przychody z chmury byłyby wyższe, gdybyśmy byli w stanie zaspokoić ten popyt” .
Szersze ograniczenia: Google wynajmuje nawet około 920 milionów dolarów miesięcznie na GPU Nvidii od SpaceX, aby wypełnić lukę w mocy obliczeniowej . Wiceprezes Google Cloud Amin Vahdat powiedział w listopadzie 2025 roku, że firma będzie musiała podwajać moc AI co sześć miesięcy, aby sprostać popytowi .
Te ograniczenia bezpośrednio motywują Frozen v2: jeśli Google uzyska 6–10 razy więcej inferencji Gemini na wat, efektywnie zwielokrotni swoją przepustowość bez konieczności budowy nowych centrów danych.
Frozen v2 to jeden z elementów znacznie szerszej strategii sprzętowej:
1. Ósma generacja TPU podzielona na chipy do trenowania i wnioskowania. Podczas Cloud Next 2026 Google zaprezentował ósmą generację układów TPU, po raz pierwszy podzieloną na dwa wyspecjalizowane warianty :
2. Długoterminowa umowa z Broadcom do 2031 roku. Broadcom złożył w SEC formularz 8-K ujawniający długoterminową umowę (Long Term Agreement) na opracowanie i dostawę niestandardowych TPU dla przyszłych generacji Google'a, a także umowę gwarancji dostaw (Supply Assurance Agreement) komponentów sieciowych do 2031 roku . Osobno Anthropic podpisał umowę na około 3,5 GW mocy TPU Google'a, która ma być dostępna od 2027 roku .
3. Wynajem TPU klientom, w tym OpenAI. Doniesienia wskazują, że Google coraz częściej oferuje moce TPU jako produkt do wynajęcia zewnętrznym firmom AI, a wśród klientów wymieniane jest OpenAI .
4. Projekt "Icefish" z MediaTek. Kodowa nazwa "Icefish" pojawia się w kontekście zaangażowania MediaTek w niestandardowy projekt chipowy dla Google'a poza TPU 8i – prawdopodobnie akceleratora inferencyjnego o niższej mocy lub brzegowego .
5. Rozmowy z Intelem. Według doniesień Google prowadził rozmowy z Intelem na temat niestandardowych projektów chipów AI, choć nie ogłoszono żadnej formalnej umowy .
6. Ironwood (siódma generacja TPU) ogólnie dostępny. Ironwood został udostępniony klientom chmurowym w kwietniu 2026 roku . Zbudowany w procesie 3 nm z architekturą dual-chiplet, został zoptymalizowany dla modeli MoE zasilających ekosystem Gemini .
Raport The Information wyraźnie stwierdza, że Frozen v2 jest zaprojektowany jako uzupełnienie, a nie zamiennik mapy drogowej TPU Google'a . Logika jest prosta:
Jest to analogiczne do wykorzystywania przez hyperscalerów zarówno ogólnego przeznaczenia CPU dla większości obciążeń, jak i ASIC-ów o stałej funkcji do konkretnych, masowych zadań (np. transkodowanie wideo, odciążanie sieci). Frozen v2 jest odpowiednikiem w świecie AI: dedykowanym silnikiem inferencyjnym, który działa obok programowalnej floty TPU.