- Startseite
- KI-Modelle
- Ternary Bonsai 2 27B
Ternary Bonsai 2 27B
PrismML
- Veröffentlicht
- 17. September 2026
- Datenstand
- 3. Oktober 2026
Ternary Bonsai 2 27B komprimiert Qwen3.8-27B auf ternäre Gewichte. Die dicht gepackten PTQ1_0-Dateien benötigen laut PrismML 5,95 GB für das Sprachmodell und speichern 1,75 Bit pro Gewicht. Die separat gelieferte visuelle Komponente kommt bei Bildeingaben hinzu.
Der Checkpoint umfasst insgesamt 27,36 Milliarden Parameter und verarbeitet 262.144 Token Kontext. Die Architektur des Basismodells bleibt erhalten. PrismML veröffentlicht die Gewichte unter Apache 2.0; die idealisierte ternäre Präzision von 1,72 Bit unterscheidet sich vom tatsächlich ausgelieferten PTQ1_0-Format.
Seite 1 von 2
Messungen ohne passende Vergleichswerte
Für diese Messungen fehlen passende Vergleichswerte unter gleichen Testbedingungen. Die Originalwerte und Quellen bleiben hier nachlesbar.
MMLU-Redux (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 89.09
- Bewertung
- 89.09
- Messgröße
- MMLU-Redux
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
GPQA Diamond (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 85.76
- Bewertung
- 85.76
- Messgröße
- GPQA Diamond
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
GSM8K (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 96.66
- Bewertung
- 96.66
- Messgröße
- GSM8K
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
AIME25 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 95
- Bewertung
- 95
- Messgröße
- AIME25
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
AIME26 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 95.83
- Bewertung
- 95.83
- Messgröße
- AIME26
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
HumanEval+ (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 95.12
- Bewertung
- 95.12
- Messgröße
- HumanEval+
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
LiveCodeBench v6 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 90.07
- Bewertung
- 90.07
- Messgröße
- LiveCodeBench v6
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
IFEval (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 91.31
- Bewertung
- 91.31
- Messgröße
- IFEval
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
IFBench (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 74
- Bewertung
- 74
- Messgröße
- IFBench
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
tau2-Bench (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 80.22
- Bewertung
- 80.22
- Messgröße
- tau2-Bench
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
BFCL v3 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 74.92
- Bewertung
- 74.92
- Messgröße
- BFCL v3
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
OCR Bench v2 (Messwert, Testbedingungen und Quelle anzeigen)
- Originalwert
- 56.88
- Bewertung
- 56.88
- Messgröße
- OCR Bench v2
- Einheit
- %
- Kategorie
- source-specific
- Richtung
- Mehr ist besser
- Quellentyp
- vendor-reported
- Auswertung
- PrismML whitepaper Tables 7, 8, 10 and methodology
- Status
- active
- Abrufdatum
- 2026-10-04
- Methodik
- Vom Anbieter veröffentlichter Wert. NVIDIA H100, EvalScope + vLLM, TP2/DP4, thinking mode, xhigh, top-p 0.95/top-k 20, temperature 1.0, reasoning parser strips thought block. Most tasks single-pass; GPQA mean 5 samples/question; AIME25/26 mean 8/problem; vision tower loaded for vision tasks. Twenty-benchmark suite plus Terminal-Bench 2.1 and SWE-Bench Verified.
- Einordnung
- Quellenspezifische Beobachtung, keine gemeinsame Vergleichsgruppe.
Seite 1 von 2
Quellen und Datenstand
Alle Angaben verweisen auf die zugrunde liegende Dokumentation oder das jeweilige Leaderboard.
| Art | Nachweis und Datenstand |
|---|---|
| Recherchestand | Recherchestand 4. Oktober 2026. 1 Quellen-URLs geprüft. Das dokumentiert die geprüften Quellen, nicht sämtliche Veröffentlichungen zu diesem Modell. |
| Weitere Quelle | PrismML Bonsai 2 27B announcement (abgerufen 3. Oktober 2026) · PrismML Bonsai 2 27B announcement · Redaktionelle Beschreibung geprüft am 4. Oktober 2026 |
| Weitere Quelle | Ternary Bonsai 2 model card (abgerufen 3. Oktober 2026) · Ternary Bonsai 2 model card · Redaktionelle Beschreibung geprüft am 4. Oktober 2026 |
| Weitere Quelle | PrismML whitepaper Tables 7, 8, 10 and methodology (abgerufen 4. Oktober 2026) |