- Startseite
- KI-Modelle
- Naive-N0.5-Flash
SprachmodellOffene Gewichte
Naive-N0.5-Flash
NaiveAI
- Veröffentlicht
- -
- Datenstand
- 3. Oktober 2026
Naive-N0.5-Flash kombiniert Sliding-Window Attention mit DeepSeek Sparse Attention für ein 1M-Token-Kontextfenster. Der offene MoE-Checkpoint richtet sich auf Coding und KI-Forschung und aktiviert 15,5 seiner 309 Milliarden Parameter pro Token.
NaiveAI veröffentlicht die Gewichte unter MIT. Die Modellkarte dokumentiert die Bereitstellung in FP8 auf NVIDIA-Hardware.
Technische Daten und Zugang
| Angabe | Wert und Quelle |
|---|---|
| Modellkennung | NaiveAI/Naive-N0.5-FlashQuelle |
| Modellklasse | Mixture-of-Experts-Modell für Coding und KI-ForschungQuelle |
| Parameter | 309 Milliarden insgesamt, 15,5 Milliarden aktivQuelle |
| Kontextfenster | 1M Token laut ModellkarteQuelle |
| Architektur | Hybrid aus Sliding-Window Attention und DeepSeek Sparse AttentionQuelle |
| Lizenz | MITQuelle |
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
MLE-bench-30 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 73.7
- Bewertung
- 73.7
- Messgröße
- MLE-bench-30
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
DeepSWE v1.1 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 67.8
- Bewertung
- 67.8
- Messgröße
- DeepSWE v1.1 reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
Agents Last Exam (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 32.4
- Bewertung
- 32.4
- Messgröße
- Agents Last Exam reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
TerminalBench 2.1 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 86.7
- Bewertung
- 86.7
- Messgröße
- TerminalBench 2.1 reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
SWE-Bench Pro (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 73.6
- Bewertung
- 73.6
- Messgröße
- SWE-Bench Pro reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
ProgramBench (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 17.5
- Bewertung
- 17.5
- Messgröße
- ProgramBench reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
NL2Repo (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 71.9
- Bewertung
- 71.9
- Messgröße
- NL2Repo reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
FrontierSWE v1 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 78.2
- Bewertung
- 78.2
- Messgröße
- FrontierSWE v1 reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
PostTrainBench (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 37.5
- Bewertung
- 37.5
- Messgröße
- PostTrainBench reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
PaperBench (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 63.2
- Bewertung
- 63.2
- Messgröße
- PaperBench reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
SOL-ExecBench meanSOL (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 72.81
- Bewertung
- 72.81
- Messgröße
- SOL-ExecBench meanSOL reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
NanoChat AutoResearch validation BPB (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 0.9051
- Bewertung
- 0.9051
- Messgröße
- NanoChat AutoResearch validation BPB reported score
- Einheit
- Keine Einheit angegeben
- Kategorie
- source-specific
- Richtung
- Weniger ist besser
- Quellentyp
- vendor-reported
- Auswertung
- Provider model card
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. Official image-only card, visually inspected. Default Claude Code 2.1.207, 1M context, tool environment; proprietary agent/R&D harnesses.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe. Die Quelle benennt für diesen Zahlenwert keine Einheit oder Skala.
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 1 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Weitere Quelle | Naive-N0.5-Flash model card (abgerufen 3. Oktober 2026; 4. Oktober 2026) · Naive-N0.5-Flash model card · Redaktionelle Beschreibung geprüft am 4. Oktober 2026 |