Google pracuje nad układem serwerowym „Frozen v2”, który wbudowuje architekturę modelu Gemini bezpośrednio w krzem jako ASIC o stałej funkcji, celując w 6–10 razy więcej tokenów na wat niż najnowsze TPU – ale może uru... Projekt wynika z poważnego niedoboru mocy obliczeniowej AI, który zmusił Google do racjonowania...

Create a landscape editorial hero image for this Studio Global article: Search & fact-check with cited sources for What is Google's new custom server chip that bakes its Gemini AI model's architecture directly in. Article summary: Here is a comprehensive, sourced answer to your full question.. Topic tags: general, general web, user generated, news, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Google stawia na największy hazard sprzętowy w swojej historii. Firma opracowuje układ serwerowy o wewnętrznej nazwie kodowej 'Frozen v2', który wbudowuje elementy architektoniczne modelu AI Gemini bezpośrednio w krzem jako ASIC o stałej funkcji. Jako pierwszy poinformował o tym serwis The Information 20 lipca 2026 roku. Projekt ma radykalnie poprawić efektywność w tokenach na wat podczas wnioskowania (inferencji) Gemini – kosztem niemożności uruchomienia kiedykolwiek innego modelu .
Frozen v2 to silnik wnioskowania przeznaczony do konkretnego zastosowania (application-specific inference engine), a nie ogólny procesor tensorowy, jakim są jednostki TPU Google'a. TPU to programowalne akceleratory, które za pomocą konfiguracji programowej obsługują szeroką gamę modeli AI . Frozen v2 jest ich przeciwieństwem: specyficzna architektura Gemini – jej warstwy, operatory i przepływ danych – jest trwale zapisywana w krzemie na etapie produkcji, co czyni z niego układ typu „Gemini w chipie”.
Głównym osiągnięciem jest efektywność: według doniesień inżynierowie Google'a szacują, że Frozen v2 może dostarczać 6 do 10 razy więcej tokenów AI na jednostkę zużytej energii niż najnowsze układy TPU .
Zgodnie z raportem The Information i potwierdzającymi go doniesieniami, wdrożenie Frozen v2 planowane jest najwcześniej na 2028 rok . Oznacza to, że układ jest jeszcze kilka lat od produkcji i trafi do użytku dopiero po wdrożeniu i dojrzałości obecnej, ósmej generacji układów TPU (Sunfish i Zebrafish).
Startup Taalas pokazuje dokładnie, co ten kompromis oznacza w praktyce. W lutym 2026 roku Taalas zaprezentował układ HC1, który koduje cały model Llama 3.1 8B – każdy parametr – bezpośrednio w obwodach tranzystorowych chipa za pomocą mask ROM, bez zewnętrznej pamięci HBM do przechowywania wag .
Liczby są oszałamiające:
Wady są równie spektakularne:
Założyciel Taalas opisał architekturę jako połączenie „mask ROM recall fabric” z „SRAM recall fabric”, która przechowuje zarówno model, jak i wykonuje wszystkie operacje pamięci podręcznej KV na chipie, całkowicie eliminując zewnętrzny transfer pamięci . Jest to to samo podstawowe podejście, które zastosuje Frozen v2.
Moc obliczeniowa AI Google'a jest tak przeciążona, że firma zaczęła racjonować dostęp nawet płacącym gigantom. Kilka danych wyjaśnia motywację:
Odmowa Meta (marzec 2026): Google poinformował Meta w marcu 2026 roku, że nie jest w stanie dostarczyć całej mocy obliczeniowej Gemini, którą Meta chciała kupić . Niedobór opóźnił niektóre wewnętrzne projekty AI Meta i zmusił firmę do polecenia inżynierom oszczędzania tokenów AI
.
Zaległości w realizacji: Zaległości w zamówieniach Google Cloud prawie się podwoiły, osiągając 462 miliardy dolarów w pierwszym kwartale 2026 roku, co stanowi popyt około 23-krotnie przekraczający dostępną moc przetwarzania . CEO Sundar Pichai potwierdził podczas telekonferencji wynikowej: „Jesteśmy w najbliższym czasie ograniczeni mocą obliczeniową… nasze przychody z chmury byłyby wyższe, gdybyśmy byli w stanie zaspokoić ten popyt”
.
Szersze ograniczenia: Google wynajmuje nawet około 920 milionów dolarów miesięcznie na GPU Nvidii od SpaceX, aby wypełnić lukę w mocy obliczeniowej . Wiceprezes Google Cloud Amin Vahdat powiedział w listopadzie 2025 roku, że firma będzie musiała podwajać moc AI co sześć miesięcy, aby sprostać popytowi
.
Te ograniczenia bezpośrednio motywują Frozen v2: jeśli Google uzyska 6–10 razy więcej inferencji Gemini na wat, efektywnie zwielokrotni swoją przepustowość bez konieczności budowy nowych centrów danych.
Frozen v2 to jeden z elementów znacznie szerszej strategii sprzętowej:
1. Ósma generacja TPU podzielona na chipy do trenowania i wnioskowania. Podczas Cloud Next 2026 Google zaprezentował ósmą generację układów TPU, po raz pierwszy podzieloną na dwa wyspecjalizowane warianty :
2. Długoterminowa umowa z Broadcom do 2031 roku. Broadcom złożył w SEC formularz 8-K ujawniający długoterminową umowę (Long Term Agreement) na opracowanie i dostawę niestandardowych TPU dla przyszłych generacji Google'a, a także umowę gwarancji dostaw (Supply Assurance Agreement) komponentów sieciowych do 2031 roku . Osobno Anthropic podpisał umowę na około 3,5 GW mocy TPU Google'a, która ma być dostępna od 2027 roku
.
3. Wynajem TPU klientom, w tym OpenAI. Doniesienia wskazują, że Google coraz częściej oferuje moce TPU jako produkt do wynajęcia zewnętrznym firmom AI, a wśród klientów wymieniane jest OpenAI .
4. Projekt "Icefish" z MediaTek. Kodowa nazwa "Icefish" pojawia się w kontekście zaangażowania MediaTek w niestandardowy projekt chipowy dla Google'a poza TPU 8i – prawdopodobnie akceleratora inferencyjnego o niższej mocy lub brzegowego .
5. Rozmowy z Intelem. Według doniesień Google prowadził rozmowy z Intelem na temat niestandardowych projektów chipów AI, choć nie ogłoszono żadnej formalnej umowy .
6. Ironwood (siódma generacja TPU) ogólnie dostępny. Ironwood został udostępniony klientom chmurowym w kwietniu 2026 roku . Zbudowany w procesie 3 nm z architekturą dual-chiplet, został zoptymalizowany dla modeli MoE zasilających ekosystem Gemini
.
Raport The Information wyraźnie stwierdza, że Frozen v2 jest zaprojektowany jako uzupełnienie, a nie zamiennik mapy drogowej TPU Google'a . Logika jest prosta:
Jest to analogiczne do wykorzystywania przez hyperscalerów zarówno ogólnego przeznaczenia CPU dla większości obciążeń, jak i ASIC-ów o stałej funkcji do konkretnych, masowych zadań (np. transkodowanie wideo, odciążanie sieci). Frozen v2 jest odpowiednikiem w świecie AI: dedykowanym silnikiem inferencyjnym, który działa obok programowalnej floty TPU.
Studio Global AI
Use this topic as a starting point for a fresh source-backed answer, then compare citations before you share it.
Google pracuje nad układem serwerowym „Frozen v2”, który wbudowuje architekturę modelu Gemini bezpośrednio w krzem jako ASIC o stałej funkcji, celując w 6–10 razy więcej tokenów na wat niż najnowsze TPU – ale może uru...
Google pracuje nad układem serwerowym „Frozen v2”, który wbudowuje architekturę modelu Gemini bezpośrednio w krzem jako ASIC o stałej funkcji, celując w 6–10 razy więcej tokenów na wat niż najnowsze TPU – ale może uru... Projekt wynika z poważnego niedoboru mocy obliczeniowej AI, który zmusił Google do racjonowania dostępu nawet dla Meta.
Startup Taalas udowodnił już koncepcję: jego układ HC1 koduje model Llama 3.1 8B w pamięci mask ROM, osiągając 17 000 tokenów na sekundę i 20 krotnie niższy koszt niż GPU, ale jest trwale związany z jednym modelem – p...