Naive N0.5 Flash ist ein Modell mit offenen Gewichten für Coding und KI Forschung. Für ein natives Kontextfenster von einer Million Token kombiniert das Modell Sliding Window Attention (SWA) und DeepSeek Sparse Attention (DSA), ohne Full Attention Schichten.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is NaiveAI’s MIT-licensed, open-weight Naive-N0.5-Flash model, and how do its 309B-total/15.5B-active MoE architecture, native one-mill. Article summary: Naive-N0.5-Flash is NaiveAI’s MIT-licensed, open-weight model aimed at coding and AI research and development. The release pairs a large but sparsely activated model with a claimed native one-million-token context and a . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Naive-N0.5-Flash ist NaiveAIs Modell mit offenen Gewichten für Coding und KI-Forschung und -Entwicklung. Im Mittelpunkt stehen drei Angaben: insgesamt 309 Milliarden Parameter, davon 15,5 Milliarden pro Token aktiv, ein natives Kontextfenster von einer Million Token und die eigens entwickelte Inferenzumgebung NaiveRT.2
4
Wichtig ist der Unterschied zwischen Gesamtgröße und aktiver Berechnung: Die 15,5 Milliarden aktiven Parameter sind nicht die Gesamtgröße des Modells. NaiveAI beschreibt sowohl die Modellgewichte als auch den Inferenzcode als MIT-lizenziert.4
7
Naive-N0.5-Flash nutzt eine Mixture-of-Experts-Architektur (MoE). Vereinfacht gesagt wird für jedes Token nur ein Teil des gesamten Modells aktiviert. Laut Modellkarte umfasst das Modell 309 Milliarden Parameter, während pro Token 15,5 Milliarden aktiv sind.2 Die aktive Zahl beschreibt also die sparsame Berechnung – nicht die Gesamtzahl der Modellparameter.
NaiveAI richtet das Modell auf Coding sowie Forschung und Entwicklung im KI-Bereich aus. Es wurde auf Xiaomis MiMo-V2.5-Basismodell weitertrainiert und ist damit nicht als vollständig von Grund auf neu entwickeltes Modell beschrieben.1
2
Für das native Kontextfenster von einer Million Token setzt NaiveAI auf eine Kombination aus Sliding-Window Attention (SWA) und der leichteren DeepSeek Sparse Attention (DSA). Laut Modellbeschreibung kommt die Architektur ohne Full-Attention-Schichten aus und besteht überwiegend aus einem Verhältnis von fünf SWA-Schichten zu einer DSA-Schicht.2
7
SWA richtet den Blick auf einen begrenzten lokalen Ausschnitt; DSA ergänzt eine sparsame Methode, um weiter entfernte Informationen einzubeziehen. Der Ansatz soll lange Kontexte ermöglichen, ohne dass jede Position stets vollständig mit jeder anderen abgeglichen werden muss. Das angegebene Millionen-Token-Fenster ist eine Modellfähigkeit – für sich genommen aber kein Beleg dafür, dass jede Aufgabe mit sehr langem Kontext gleich gut gelingt.
NaiveRT ist das gemeinsam mit dem Modell veröffentlichte Inferenzsystem. NaiveAI nennt als Bestandteile unter anderem Mega-Kernel-Fusion, Programmatic Dependent Launch (PDL) und spekulatives Decoding. Für den Standard-Modus gibt das Unternehmen 50 Token pro Sekunde und Nutzer an; im Ultrafast-Modus sollen es in der Spitze bis zu 2.000 Token pro Sekunde sein.2
Diese Werte stammen vom Anbieter und sind keine Zusage für jede Hardware, Konfiguration oder Anwendung. Außerdem beschreiben sie unterschiedliche Modi: Die Angabe für Standard bezieht sich auf die Leistung pro Nutzer, während 2.000 Token pro Sekunde als Ultrafast-Spitzenwert ausgewiesen werden. Die beiden Zahlen sind daher nicht als gleichartige Messwerte oder als einheitlich zu erwartende Geschwindigkeit zu verstehen.2
Naive-N0.5-Flash verbindet offene Gewichte unter MIT-Lizenz mit einer MoE-Architektur, einem behaupteten nativen Kontext von einer Million Token und einem eigens entwickelten Serving-System.2
4
7 Für die Bewertung sollten diese technischen Spezifikationen von nachgewiesener Aufgabenqualität und tatsächlicher Leistung im eigenen Einsatz getrennt werden: Die veröffentlichten Angaben beschreiben, was NaiveAI für das Modell und NaiveRT beansprucht, belegen aber allein noch keine Ergebnisse für einen konkreten Coding- oder Forschungsworkflow.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Naive N0.5 Flash ist ein Modell mit offenen Gewichten für Coding und KI Forschung.
Naive N0.5 Flash ist ein Modell mit offenen Gewichten für Coding und KI Forschung. Für ein natives Kontextfenster von einer Million Token kombiniert das Modell Sliding Window Attention (SWA) und DeepSeek Sparse Attention (DSA), ohne Full Attention Schichten.
Das Modell baut auf Xiaomis MiMo V2.5 auf. Für NaiveRT nennt NaiveAI 50 Token pro Sekunde und Nutzer im Standard Modus sowie bis zu 2.000 Token pro Sekunde im Ultrafast Modus – beides Angaben des Anbieters.[1][2]