Jingang GC3, znany także jako King Kong GC3, to zgłaszany procesor do analizy i generowania wideo, wyposażony w 12 rdzeni RISC V, 200 TOPS obliczeń INT8 oraz 128 GB współdzielonej pamięci LPDDR5 ECC. Układ łączy wykonywanie w modelu przepływu danych z rdzeniami RISC V odpowiedzialnymi za sterowanie oraz zintegrowany...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SmarCo HT Tech’s Jingang GC3, and how does its RISC-V–controlled dataflow architecture—with 12 RISC-V cores, 200 TOPS of INT8 comput. Article summary: Jingang (King Kong) GC3 is SmarCo HT Tech’s specialized video-AI/AIGC processor: a RISC-V–controlled dataflow chip designed to perform video decoding/encoding, understanding, and generation on one platform rather than sh. Topic tags: general, government, education, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Jingang GC3, określany również jako King Kong GC3, to według dostępnych doniesień wyspecjalizowany procesor firmy SmarCo HT Tech przeznaczony do zastosowań związanych z analizą wideo, AI oraz generowaniem treści. Zamiast rozdzielać dekodowanie obrazu, wnioskowanie modeli i generowanie wideo między osobne urządzenia, układ ma łączyć te zadania w jednej platformie, wykorzystując architekturę przepływu danych. Zgłaszane parametry obejmują 12 rdzeni RISC-V, 200 TOPS obliczeń INT8 oraz 128 GB współdzielonej pamięci LPDDR5 ECC. 3
5
Najważniejsza nie jest jednak sama liczba TOPS. Argumentem stojącym za GC3 jest założenie, że w zadaniach wideo znaczna część czasu i energii może być zużywana nie na obliczenia, lecz na przesyłanie klatek, parametrów modeli i danych pośrednich między procesorami a pamięcią. Silnik dataflow, wspólna pamięć oraz zintegrowane ścieżki wideo i AI mają ograniczyć ten koszt.
W typowym systemie analizy wideo strumień jest najpierw dekodowany do postaci klatek. Następnie klatki trafiają do GPU, gdzie wykonywane jest wnioskowanie komputerowego widzenia, a wyniki przechodzą przez kolejne etapy przetwarzania. Gdy rośnie liczba jednocześnie obsługiwanych strumieni, samo przesyłanie i synchronizowanie danych może stać się wąskim gardłem, niezależnie od dostępnej mocy obliczeniowej. 3
Podobne wyzwanie dotyczy generowania wideo. Systemy oparte na dyfuzji i Transformerach operują na dużych parametrach modeli oraz wynikach pośrednich. Doniesienia dotyczące GC3 wskazują, że takie zestawy danych mogą osiągać setki gigabajtów, przez co ich wielokrotny odczyt, zapis i transfer są kosztowne pod względem przepustowości, energii i czasu. 3
To właśnie ten problem ma adresować GC3: nie tylko niedobór jednostek arytmetycznych, ale także koszt koordynowania wielu etapów dużego, silnie równoległego zadania.
W klasycznej architekturze sterowania centralny procesor lub scheduler pobiera i zleca instrukcje, a dane przemieszczają się przez kolejne poziomy hierarchii pamięci. Takie podejście jest elastyczne, ale opisy GC3 przedstawiają je jako gorzej dopasowane do niektórych regularnych i masowo równoległych operacji wideo. 3
W architekturze przepływu danych obliczenia mogą rozpocząć się, gdy dostępne są dane wymagane przez daną operację. W założeniu pozwala to lepiej wykorzystać równoległość i ograniczyć przestoje wynikające z centralnego harmonogramowania oraz globalnej synchronizacji. W przypadku wideo celem jest utrzymanie większej liczby etapów przetwarzania w działaniu bez kierowania całej pracy przez jedną ścieżkę sterowania. 3
To założenie architektoniczne, a nie dowód konkretnego przyspieszenia. Dostępne źródła nie przedstawiają niezależnych testów porównujących GC3 z nazwanymi procesorami, kartami graficznymi ani platformami do obsługi AI wideo.
W zgłaszanej konstrukcji 12 rdzeni RISC-V pełni funkcję programowalnej warstwy sterującej. Wyspecjalizowane ścieżki mają obsługiwać operacje wideo i AI, natomiast rdzenie RISC-V zapewniają ogólne sterowanie i planowanie zadań, zamiast pozostawiać wszystkie etapy pracy standardowemu CPU. 3
5
RISC-V nie jest więc przedstawiany jako cały silnik obliczeniowy GC3. Współpracuje z silnikiem przepływu danych oraz dedykowanymi funkcjami wideo i AI. Daje to platformie programowalną warstwę kontroli, a najbardziej wymagające operacje wysokiej przepustowości przenosi do wyspecjalizowanego sprzętu.
Według dostępnych informacji GC3 korzysta ze 128 GB współdzielonej pamięci LPDDR5 ECC, dostępnej dla ścieżek CPU, VPU, GPU i NPU. 3
5 Zamierzoną korzyścią jest ograniczenie kopiowania danych między oddzielnymi pulami pamięci CPU i GPU.
Wspólna pula może pozwolić, aby zdekodowane klatki, wagi modeli i tensory pośrednie pozostawały dostępne dla wielu bloków obliczeniowych bez konieczności tak częstego przesyłania ich między urządzeniami. ECC zapewnia mechanizmy ochrony przed błędami w podsystemie pamięci; badania nad procesorami RISC-V analizowały również pamięć chronioną ECC jako sposób na zwiększenie odporności na awarie. 1
Współdzielona pamięć nie usuwa wszystkich ograniczeń przepustowości. Zmienia sposób, w jaki poszczególne bloki obliczeniowe korzystają z danych, a jej praktyczna wartość będzie zależeć między innymi od przepustowości pamięci, stosu programistycznego, planowania zadań i charakterystyki obciążenia.
Zgłaszana konstrukcja łączy kodowanie i dekodowanie wideo z obliczeniami AI na jednej platformie. Ma to stworzyć krótszą drogę od pobrania obrazu do jego analizy, a także od wygenerowania treści do jej zakodowania. 3
5
Zakładany przepływ pracy wygląda następująco:
Nie oznacza to, że każda operacja odbywa się w jednym nierozdzielnym kroku. Chodzi o ograniczenie zbędnych przekazań między procesorami i systemami pamięci, które w tradycyjnej konfiguracji byłyby od siebie oddzielone.
Zakładany efekt ekonomiczny wynika bezpośrednio z architektury układu. Jeśli zadanie wymaga mniej kopiowania, mniej odwołań do pamięci i mniej synchronizacji między urządzeniami, potencjalnie mniej czasu i energii jest zużywane na przemieszczanie danych zamiast na właściwe obliczenia. Może to mieć znaczenie przy analizie wielu strumieni wideo, lokalnym przetwarzaniu obrazu oraz generowaniu wideo z dużymi tensorami pośrednimi. 3
Potencjalne korzyści można podzielić na trzy obszary:
Są to jednak cele opisane w dostępnych materiałach i pozycjonowanie producenta, a nie niezależnie potwierdzone wyniki. Źródła podają główne parametry oraz uzasadnienie architektoniczne, ale nie dowodzą zmniejszenia kosztu obsługi pojedynczego wideo, poboru energii na strumień ani opóźnienia całego procesu.
Zgłaszana wartość 200 TOPS opisuje wydajność obliczeń AI w formacie INT8, a nie gwarantowaną wydajność konkretnej aplikacji. Rzeczywista przepustowość zadań wideo będzie zależeć również od zgodności z modelem, użytej precyzji, przepustowości pamięci, wsparcia kompilatora i środowiska uruchomieniowego, obsługiwanych formatów wideo, rozmiaru partii, liczby strumieni oraz skuteczności harmonogramowania przepływu danych.
Podobnie 128 GB współdzielonej pamięci może ułatwić przechowywanie dużych modeli i danych pośrednich, ale sama pojemność nie dowodzi, że konkretny model generowania wideo będzie działał wydajnie. Kluczowe pozostają wsparcie programowe i rzeczywisty ruch danych w pamięci.
Jingang GC3 najlepiej rozumieć jako wyspecjalizowaną próbę przeprojektowania ścieżki przetwarzania AI wideo wokół lokalności danych. Zgłaszane połączenie wykonywania w modelu przepływu danych, rdzeni sterujących RISC-V, zintegrowanych ścieżek CPU/VPU/GPU/NPU oraz 128 GB współdzielonej pamięci ma odpowiadać na problemy transferów i barier synchronizacji, które mogą ograniczać klasyczne potoki CPU–GPU. 3
5
Jeśli sprzęt i oprogramowanie będą współpracować zgodnie z założeniami, architektura może usprawnić analizę wielu strumieni wideo oraz generowanie materiałów. Na obecnym etapie najbardziej ostrożny wniosek brzmi jednak: GC3 przedstawia interesującą strategię architektoniczną i zestaw parametrów deklarowanych przez producenta, ale nie stanowi niezależnie zweryfikowanego dowodu niższych kosztów, mniejszego poboru energii ani krótszych opóźnień.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Jingang GC3, znany także jako King Kong GC3, to zgłaszany procesor do analizy i generowania wideo, wyposażony w 12 rdzeni RISC V, 200 TOPS obliczeń INT8 oraz 128 GB współdzielonej pamięci LPDDR5 ECC.
Jingang GC3, znany także jako King Kong GC3, to zgłaszany procesor do analizy i generowania wideo, wyposażony w 12 rdzeni RISC V, 200 TOPS obliczeń INT8 oraz 128 GB współdzielonej pamięci LPDDR5 ECC. Układ łączy wykonywanie w modelu przepływu danych z rdzeniami RISC V odpowiedzialnymi za sterowanie oraz zintegrowanymi ścieżkami CPU, VPU, GPU i NPU.
Celem projektu jest ograniczenie przesyłania klatek, danych modeli i wyników pośrednich między oddzielnymi urządzeniami, co ma pomóc w obsłudze wielu strumieni wideo i generowaniu materiałów.