Die API-Preise liegen bei 0,14 $ pro Million Input-Tokens und 0,28 $ pro Million Output-Tokens. Für zwischengespeicherte Eingaben (Cache Hit) werden sogar nur 0,028 $ pro Million Tokens fällig . Damit ist V4-Flash eine der günstigsten leistungsfähigen Reasoning-APIs auf dem Markt – deutlich billiger als Gemini 2.5 Flash mit 0,30 $/2,50 $ pro Million Tokens .
Der neu trainierte „0731-Build“, der am 31. Juli 2026 veröffentlicht wurde, gilt als offizielle öffentliche Beta der API. In Agenten-Benchmarks übertrifft dieser Build sogar die größere V4-Pro-Preview mit einem Score von 82,7 auf Terminal Bench 2.1 und 76,7 auf Cybergym . Das Modell unterstützt konfigurierbare Reasoning-Modi (Standard, High und Max Thinking Effort) sowie einen Non-Thinking-Modus für Hochdurchsatz-Pipelines .
MiniMax brachte H3 am 31. Juli 2026 auf den Markt und positionierte es als universelles multimodales Generierungsmodell, das Texte, Bilder, Videos und Audio in einem einheitlichen Kontext verarbeiten kann . Das Modell erzeugt bis zu 15 Sekunden lange 2K-Videos (2560×1440 Pixel) mit 24 Bildern pro Sekunde und nativem Stereo-Ton – alles in einem einzigen Inferenzdurchlauf, ohne separate Audio-Pipeline .
H3 akzeptiert bis zu 9 Bilder + 3 Videoclips + 3 Audiospuren als gleichzeitige Referenzeingaben . MiniMax kündigte an, die Modellgewichte innerhalb weniger Tage zu veröffentlichen und damit den Open-Weight-Ansatz auch auf die Videogenerierung auszuweiten, während die meisten kommerziellen Konkurrenten proprietär bleiben . Das Unternehmen gibt an, dass die Kosten pro Sekunde bei 2K-Auflösung weniger als ein Drittel der etablierten Konkurrenz betragen .
ByteDance kündigte Seedance 2.5 auf seiner Volcano Engine FORCE-Konferenz am 23. Juni 2026 an , der öffentliche API-Zugang wurde am 16. Juli 2026 freigegeben .
Die wichtigste Neuerung: 30-sekündige Single-Pass-Videogenerierung – das Modell liefert einen vollständigen Clip in einem durchgehenden Generierungsschritt, ohne dass kürzere Segmente zusammengesetzt werden müssen . Die Auflösung erreicht bis zu 4K (3840×2160 Pixel) mit 10-Bit-Farbtiefe . Das Modell akzeptiert bis zu 50 multimodale Referenzeingaben – darunter Bilder, Audioclips, 3D-Weißmodelle, Stilvorlagen und Szenenanweisungen – gegenüber 12 in der Vorgängerversion .
ByteDance veröffentlichte außerdem eine regionale Bearbeitungsfunktion, mit der Nutzer bestimmte Bereiche eines generierten Clips ändern können, ohne die gesamte Sequenz neu generieren zu müssen . Die Anwendungsmöglichkeiten reichen von Film und Werbung über Bildung und industrielle Fertigung bis hin zu Simulationen für autonomes Fahren .
Diese drei Veröffentlichungen, die sich stark auf den 31. Juli 2026 konzentrieren, folgen gemeinsamen strategischen Mustern:
Die ursprüngliche Darstellung legte nahe, dass diese drei Veröffentlichungen am 26. Dezember 2024 stattfanden, zusammen mit breiteren Behauptungen über chinesische Open-Source-Modelle, die 41 % der weltweiten Downloads ausmachen, und US-Vorwürfen des Model-Distillations. Die verfügbaren Suchergebnisse stützen weder das Datum Dezember 2024 noch diese spezifischen Statistiken. Diese Behauptungen könnten sich auf frühere DeepSeek-V3- oder Qwen-Ereignisse beziehen, konnten aber mit den bereitgestellten Quellen nicht verifiziert werden.
| Modell | Veröffentlichungsdatum | Wichtigste Spezifikationen |
|---|---|---|
| DeepSeek V4-Flash | Vorschau: 24.04.2026; Öffentliche Beta: 31.07.2026 | 284B MoE (13B aktiv), 1M Kontext, 0,14 $/M Input-Tokens |
| MiniMax H3 | 31.07.2026 | 15s 2K-Video, nativer Stereo-Ton, Open Weights versprochen |
| ByteDance Seedance 2.5 | Angekündigt: 23.06.2026; API: 16.07.2026 | 30s Single-Pass, 4K, 50 multimodale Referenzeingaben |
Diese drei Modelle – DeepSeek V4-Flash, MiniMax H3 und ByteDance Seedance 2.5 – repräsentieren eine koordinierte Beschleunigung des chinesischen KI-Sektors im Sommer 2026, die durch niedrigere Kosten, Open-Weight-Verteilung und deutlich längere Generierungsfähigkeiten gekennzeichnet ist.