Jingang GC3, також відомий як King Kong GC3, — заявлений спеціалізований процесор для відеоШІ та генеративного ШІ з 12 ядрами RISC V, продуктивністю 200 TOPS у INT8 і 128 ГБ уніфікованої пам’яті LPDDR5 ECC. Чип поєднує dataflow обчислення з програмованими ядрами RISC V та інтегрованими шляхами CPU, VPU, GPU і NPU, щ...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is SmarCo HT Tech’s Jingang GC3, and how does its RISC-V–controlled dataflow architecture—with 12 RISC-V cores, 200 TOPS of INT8 comput. Article summary: Jingang (King Kong) GC3 is SmarCo HT Tech’s specialized video-AI/AIGC processor: a RISC-V–controlled dataflow chip designed to perform video decoding/encoding, understanding, and generation on one platform rather than sh. Topic tags: general, government, education, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
Jingang GC3, або King Kong GC3, у доступних матеріалах описують як спеціалізований процесор для відеоШІ та генеративного ШІ від SmarCo HT Tech. Замість того щоб розділяти декодування відео, ШІ-інференс і генерацію відео між різними пристроями, чип має об’єднати ці етапи в одній dataflow-орієнтованій архітектурі. Серед заявлених характеристик — 12 ядер RISC-V, 200 TOPS обчислень INT8 і 128 ГБ уніфікованої пам’яті LPDDR5 ECC. 3
5
Ключова ідея GC3 полягає не лише у великому показнику TOPS. Відеозадачі часто витрачають значну частину часу та енергії на переміщення кадрів, даних моделей і проміжних результатів між процесорами та пам’яттю. Dataflow-двигун, спільна пам’ять і вбудовані відео- та ШІ-шляхи мають скоротити такі переміщення.
У типовому конвеєрі аналізу відео потік спочатку декодується у кадри, потім кадри передаються на GPU для комп’ютерного зору, а результати проходять через додаткові етапи обробки. Коли одночасно зростає кількість потоків, передавання та синхронізація даних можуть стати таким самим вузьким місцем, як і самі обчислення. 3
У генерації відео виникає схожа проблема. Системи на основі дифузійних моделей і трансформерів працюють із великими параметрами та проміжними результатами. За описами GC3, обсяг таких проміжних наборів даних може сягати сотень гігабайтів, тому повторні читання, записи й пересилання дорого обходяться з погляду пропускної здатності, енергоспоживання та часу. 3
Саме це й намагається вирішити GC3: не просто додати більше арифметичних блоків, а зменшити ціну координації численних етапів великого паралельного навантаження.
У традиційній архітектурі керування центральний процесор або планувальник отримує та видає інструкції, а дані проходять через ієрархію пам’яті. Такий підхід гнучкий, однак, за описом GC3, він не завжди добре підходить для регулярних і масово паралельних відеооперацій. 3
У dataflow-архітектурі обчислення може запускатися тоді, коли доступні потрібні для операції дані. Теоретично це дає змогу краще використати паралелізм і менше чекати через централізоване планування та глобальну координацію. Для відеозадач задум полягає в тому, щоб більше етапів обробки працювали одночасно й не проходили щоразу через єдиний центр керування. 3
Втім, це архітектурна мета, а не доказ конкретного приросту швидкодії. Доступні джерела не містять незалежних наскрізних порівнянь із конкретними CPU, GPU чи іншими платформами для відеоШІ.
Заявлені 12 ядер RISC-V виконують роль програмованого шару керування. Спеціалізовані блоки відповідають за відео- та ШІ-операції, тоді як ядра RISC-V забезпечують загальне керування й планування, не змушуючи звичайний CPU виконувати кожен етап конвеєра. 3
5
Отже, RISC-V у цій конструкції не подається як повний обчислювальний механізм. Він працює разом із dataflow-двигуном і спеціалізованими відео- та ШІ-функціями: програмованість залишається на рівні керування, а високопродуктивні операції виконуються спеціалізованим обладнанням.
За заявленими характеристиками GC3 використовує 128 ГБ уніфікованої пам’яті LPDDR5 ECC, спільної для шляхів CPU, VPU, GPU та NPU. 3
5 Очікувана перевага — менша потреба копіювати дані між окремими пулами пам’яті CPU і GPU.
Спільний пул може дозволити декодованим кадрам, вагам моделей і проміжним тензорам залишатися доступними різним обчислювальним блокам без такої кількості передавання між пристроями. ECC додає підсистемі пам’яті засоби захисту від помилок; у дослідженнях процесорів RISC-V захищену ECC пам’ять також розглядали як спосіб підвищити відмовостійкість. 1
Уніфікована пам’ять, однак, не скасовує обмеження пропускної здатності. Вона змінює спосіб доступу різних блоків до даних, а практичний ефект залежатиме від пропускної здатності пам’яті, програмного стека, планування та конкретного навантаження.
Заявлена конструкція поєднує кодування й декодування відео з ШІ-обчисленнями на одній платформі. Це має створити пряміший шлях від отримання відео до його аналізу, а також від генерації контенту до його кодування. 3
5
Передбачуваний робочий процес виглядає так:
Це не означає, що всі операції виконуються одним неподільним кроком. Йдеться про намір зменшити зайві передачі між процесорами та підсистемами пам’яті, які зазвичай працюють окремо.
Економічний ефект чипа безпосередньо випливає з його архітектури. Якщо навантаження потребує менше копіювань, звернень до пам’яті та міжпристроєвої синхронізації, менше часу й енергії витрачатиметься на переміщення даних, а не на їх обробку. Це може бути корисним для аналізу багатьох відеопотоків, локальної відеообробки та генерації відео з великими проміжними тензорами. 3
Потенційні переваги можна поділити на три категорії:
Це цілі, описані в доступних матеріалах, а не незалежно підтверджені результати. Джерела наводять ключові характеристики та архітектурне обґрунтування, але не встановлюють фактичне зниження вартості обробки відео, ват на потік або наскрізної затримки в мілісекундах.
Заявлені 200 TOPS описують теоретичну обчислювальну потужність для ШІ в INT8, але не гарантують такої продуктивності в реальних застосунках. Фактична пропускна здатність відеоШІ також залежатиме від сумісності з моделями, точності обчислень, пропускної здатності пам’яті, підтримки компілятора та середовища виконання, форматів відео, розміру пакетів, кількості потоків і роботи dataflow-планувальника.
Так само 128 ГБ уніфікованої пам’яті можуть допомогти розміщувати великі моделі та проміжні дані, але сам обсяг не доводить, що конкретна модель генерації відео працюватиме ефективно. Вирішальними залишаються програмна підтримка та реальний характер обміну даними з пам’яттю.
Jingang GC3 найкраще розглядати як спробу перебудувати відеоШІ навколо локальності даних. Заявлене поєднання dataflow-виконання, ядер RISC-V для керування, інтегрованих шляхів CPU/VPU/GPU/NPU та 128 ГБ уніфікованої пам’яті має усунути частину передач і бар’єрів синхронізації, які обмежують традиційні конвеєри CPU та GPU. 3
5
Якщо апаратне забезпечення та програмний стек працюватимуть так, як задумано, архітектура може зробити аналіз багатьох відеопотоків і генерацію відео ефективнішими. Наразі, однак, найобережніший висновок такий: GC3 демонструє переконливу архітектурну стратегію та набір заявлених виробником характеристик, але ще не є незалежно підтвердженим доказом нижчої вартості, енергоспоживання чи затримки.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Jingang GC3, також відомий як King Kong GC3, — заявлений спеціалізований процесор для відеоШІ та генеративного ШІ з 12 ядрами RISC V, продуктивністю 200 TOPS у INT8 і 128 ГБ уніфікованої пам’яті LPDDR5 ECC.
Jingang GC3, також відомий як King Kong GC3, — заявлений спеціалізований процесор для відеоШІ та генеративного ШІ з 12 ядрами RISC V, продуктивністю 200 TOPS у INT8 і 128 ГБ уніфікованої пам’яті LPDDR5 ECC. Чип поєднує dataflow обчислення з програмованими ядрами RISC V та інтегрованими шляхами CPU, VPU, GPU і NPU, щоб тримати відео та ШІ операції ближче одна до одної.
Головна мета конструкції — зменшити пересилання кадрів, ваг моделей і проміжних тензорів між окремими пристроями під час аналізу багатьох відеопотоків і генерації відео.