Open-Source-LLMs sind einer der wichtigsten KI-Trends 2026.
Und das nicht zu Unrecht:
Open-Source-Modelle waren lange Zeit deutlich schwächer als proprietäre Modelle. Bis zum Frühjahr 2026 haben sie aber aufgeholt, vor allem dank chinesischer Labs:
DeepSeek V4 Pro, GLM-5.3-Flash von Z.ai, Kimi K2.6 von Moonshot AI, Qwen3.5 von Alibaba und das neue Qwen 3.8 Flash Next zeigen, wie nah offene Gewichte an proprietäre Spitzenmodelle herankommen. Für GLM-5.3-Flash veröffentlicht Z.ai unter anderem einen Wert von 84,3 auf Terminal-Bench 2.1 und 63,4 auf DeepSWE. Diese Herstellerwerte gehören jeweils zu ihrem dokumentierten Testaufbau und sind nicht automatisch mit unabhängigen Ranglisten vergleichbar.
In diesem Artikel findest du ein sortier- und filterbares Verzeichnis mit 191 Open-Source-LLMs, inklusive Benchmark-Scores, Lizenzen, API-Preisen, Kontextfenstern und Capabilities.
Wenn du auch proprietäre Spitzenmodelle einbeziehen möchtest, findest du im LLM-Vergleich 29 aktuelle Modelle mit gemeinsamen Benchmarks, Preisen und direkten Duellen.
Zudem zeige ich dir, wie du freie LLMs einfach und kostenlos auf deinem Rechner nutzen kannst (ohne programmieren oder das Terminal nutzen zu müssen).
- GLM-5.3-Flash ergänzt die Spitzengruppe mit 320 Milliarden Gesamtparametern, 18 Milliarden aktiven Parametern, nativer Multimodalität und MIT-Lizenz
- Qwen 3.8 Flash Next ist ein multimodales MoE mit 125 Mrd. Hauptmodellparametern, 51 Mrd. N-Gram-Embeddingparametern und 6 Mrd. aktiven Parametern
- 191 Open-Source-LLMs im filter- und sortierbaren Verzeichnis, von MIT und Apache 2.0 bis zu eingeschränkten Research-Lizenzen. Spalten wie Preise, Kontext und Capabilities lassen sich einzeln ein- und ausblenden
- Chinesische Labs wie DeepSeek, Moonshot AI, Z.ai und Alibaba prägen die aktuelle Open-Weights-Spitzengruppe. Effiziente MoE-Modelle verbinden hohe Gesamtparameterzahlen mit deutlich weniger aktiven Parametern pro Token
- Lokale Nutzung mit Tools wie Ollama, LM Studio oder GPT4All möglich, die neuen Top-Modelle brauchen aber ernsthafte Hardware (Multi-GPU oder quantisierte Varianten für Consumer-Rigs)
Alle Open-Source-LLMs im Überblick
Das Verzeichnis enthält alle Open-Weights-Modelle aus dem models.dev-Katalog plus kuratierte Klassiker, standardmäßig sortiert nach Release-Datum. Über „Spalten“ blendest du weitere Daten ein, etwa Modalitäten, Wissensstand, Max. Output oder die Zahl der API-Anbieter:
192 von 192 Modellen
Hy4 preview | Tencent | – | 1M | – | – | – | Tencent Hunyuan Community | 0,67 $ | 2,00 $ | Aug. 2026 | ||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Alibaba | 125B (6B aktiv) | 256K | – | – | – | Qwen Community License 1.0 | 0,12 $ | 0,40 $ | Aug. 2026 | |||
GLM-5.3-Flash | Z.ai | 320B (18B aktiv) | 1M | – | – | 63,4 %DeepSWE | MIT | 0,015 $ | 0,025 $ | Aug. 2026 | ||
| DeepReinforce | 35B (3B aktiv) | 256K | – | – | – | MIT | 0,10 $ | 0,40 $ | Aug. 2026 | |||
| Alibaba | 27B | 256K | – | – | 61,7 %SWE-bench Pro | Apache 2.0 | 0,10 $ | 0,40 $ | Aug. 2026 | |||
GLM-5.3 | Z.ai | – | 1M | – | – | – | MIT | 0,40 $ | 1,40 $ | Aug. 2026 | ||
| Alibaba | – | 256K | – | – | – | qwen3.8-max | 2,00 $ | 6,00 $ | Aug. 2026 | |||
| DeepSeek | – | 1M | – | – | – | MIT | 0,35 $ | 0,80 $ | Aug. 2026 | |||
Nemotron 3.5 Lightning 30B A3B | NVIDIA | 30B (3B aktiv) | 256K | – | – | – | NVIDIA Open Model License | 0,050 $ | 0,15 $ | Aug. 2026 | ||
| Meta | 30B | 128K | – | – | 76 %SWE-Bench Verified | Apache 2.0 | 0,20 $ | 0,80 $ | Aug. 2026 | |||
| DeepSeek | – | 1M | – | – | 82,7 %Terminal-Bench | MIT | 0,030 $ | 0,10 $ | Juli 2026 | |||
| thinkingmachines | – | 1M | – | – | – | Apache-2.0 | 0,45 $ | 1,20 $ | Juli 2026 | |||
Laguna S 2.1 | Poolside | – | 1M | – | – | – | – | 0,090 $ | 0,18 $ | Juli 2026 | ||
Kimi K3 | Moonshot AI | – | 1M | – | – | 88,3 %Terminal-Bench | – | 2,00 $ | 8,00 $ | Juli 2026 | ||
| thinkingmachines | – | 1M | – | – | – | Apache-2.0 | 0,95 $ | 4,05 $ | Juli 2026 | |||
| Tencent | – | 250K | – | – | 78 %SWE-Bench Verified | Tencent Hunyuan Community | 0,066 $ | 0,26 $ | Juli 2026 | |||
| Poolside | 33B (3B aktiv) | 256K | – | – | 70,9 %SWE-Bench Verified | OpenMDW-1.1 | 0,060 $ | 0,12 $ | Juli 2026 | |||
Ornith 1.0 31B | DeepReinforce | 31B | 256K | – | – | – | MIT | – | – | Juni 2026 | ||
| DeepReinforce | 35B | 256K | – | – | 75,6 %SWE-Bench Verified | MIT | – | – | Juni 2026 | |||
| DeepReinforce | 397B | 256K | – | – | 82,4 %SWE-Bench Verified | MIT | – | – | Juni 2026 | |||
| DeepReinforce | 9B | 256K | – | – | 69,4 %SWE-Bench Verified | MIT | – | – | Juni 2026 | |||
| Z.ai | – | 1M | – | 91,2 %GPQA | 62,1 %SWE-Bench Pro | MIT | 0,30 $ | 1,05 $ | Juni 2026 | |||
| Moonshot AI | 1T (32B aktiv) | 256K | – | 89,6 %GPQA | 67,4 %Terminal-Bench | Modified MIT | 0,28 $ | 1,10 $ | Juni 2026 | |||
| Moonshot AI | 1T (32B aktiv) | 256K | – | 89,6 %GPQA | 67,4 %Terminal-Bench | Modified MIT | 1,90 $ | 8,00 $ | Juni 2026 | |||
North Mini Code | Cohere | – | 250K | – | – | 61 %SWE-Bench Verified | – | – | – | Juni 2026 | ||
| Xiaomi | – | 1M | – | – | – | MIT | 1,31 $ | 2,61 $ | Juni 2026 | |||
Nemotron 3 Ultra 550B A55B | NVIDIA | 550B (55B aktiv) | 1M | 86,8 %MMLU-Pro | 87 %GPQA | 89 %LiveCodeBench | NVIDIA Open Model License | 0,10 $ | 0,10 $ | Juni 2026 | ||
| MiniMax | – | 1M | – | 92,9 %GPQA | 80,5 %SWE-Bench Verified | MIT | 0,23 $ | 0,90 $ | Juni 2026 | |||
| StepFun | – | 250K | – | – | 76,5 %SWE-Bench Verified | Apache 2.0 | 0,19 $ | 1,11 $ | Mai 2026 | |||
Command A Plus | Cohere | – | 125K | – | – | – | CC BY-NC-4.0 | 2,50 $ | 10,00 $ | Mai 2026 | ||
| openbmb | 1B | 128K | – | – | – | apache-2.0 | 0,12 $ | 0,74 $ | Mai 2026 | |||
| Mistral AI | 128B | 256K | – | – | 77,6 %SWE-Bench Verified | – | 1,39 $ | 6,90 $ | Apr. 2026 | |||
Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 30B (3B aktiv) | 250K | 77,3 %MMLU-Pro | 72,2 %GPQA | 63,2 %LiveCodeBench | NVIDIA Open Model License | 0,11 $ | 0,42 $ | Apr. 2026 | ||
| Poolside | 225B (23B aktiv) | 256K | – | – | 74,6 %SWE-Bench Verified | Apache 2.0 | – | – | Apr. 2026 | |||
| Poolside | 33B (3B aktiv) | 256K | – | – | 69,9 %SWE-Bench Verified | Apache 2.0 | – | – | Apr. 2026 | |||
| DeepSeek | 284B (13B aktiv) | 1M | 83 %MMLU-Pro | 85 %GPQA | 88 %LiveCodeBench | MIT | 0,050 $ | 0,10 $ | Apr. 2026 | |||
| DeepSeek | 1,6T (49B aktiv) | 1M | 87,5 %MMLU-Pro | 90,1 %GPQA | 93,5 %LiveCodeBench | MIT | 0,35 $ | 0,70 $ | Apr. 2026 | |||
DeepSeek V4 Pro 0423 | DeepSeek | – | 1M | – | – | – | MIT | 1,32 $ | 3,30 $ | Apr. 2026 | ||
| Alibaba | 27B | 256K | 86,2 %MMLU-Pro | 87,8 %GPQA | 77,2 %SWE-Bench Verified | Apache 2.0 | 0,20 $ | 0,60 $ | Apr. 2026 | |||
| Xiaomi | 310B (15B aktiv) | 1M | 86,3 %MMLU | – | 56,1 %SWE-Bench Pro | MIT | 0,14 $ | 0,28 $ | Apr. 2026 | |||
| Xiaomi | – | 1M | 89,4 %MMLU | – | 78,9 %SWE-Bench Verified | MIT | 0,40 $ | 0,80 $ | Apr. 2026 | |||
| Moonshot AI | 1T (32B aktiv) | 256K | 84,6 %MMLU-Pro | 90,5 %GPQA | 92 %HumanEval | Modified MIT | 0,22 $ | 1,10 $ | Apr. 2026 | |||
| Tencent | – | 250K | 87,4 %MMLU | 87,2 %GPQA | 74,4 %SWE-Bench Verified | Tencent Hunyuan Community | 0,066 $ | 0,26 $ | Apr. 2026 | |||
| Alibaba | 35B (3B aktiv) | 256K | 85,2 %MMLU-Pro | 86 %GPQA | 73,4 %SWE-Bench Verified | Apache 2.0 | 0,070 $ | 0,42 $ | Apr. 2026 | |||
| Z.ai | 754B | 200K | 91,7 %MMLU | 85,7 %GPQA | 58,4 %SWE-Bench Pro | MIT | 0,45 $ | 2,15 $ | Apr. 2026 | |||
| 26B (4B aktiv) | 256K | 82,6 %MMLU-Pro | 82,3 %GPQA | 77,1 %LiveCodeBench | Gemma Terms of Use | 0,042 $ | 0,22 $ | Apr. 2026 | ||||
| 31B | 256K | 85,2 %MMLU-Pro | 84,3 %GPQA | 80 %LiveCodeBench | Gemma Terms of Use | 0,090 $ | 0,30 $ | Apr. 2026 | ||||
| – | 128K | 60 %MMLU-Pro | 43,4 %GPQA | 44 %LiveCodeBench | Gemma Terms of Use | 0,020 $ | 0,10 $ | Apr. 2026 | ||||
| – | 128K | 69,4 %MMLU-Pro | 58,6 %GPQA | 52 %LiveCodeBench | Gemma Terms of Use | 0,020 $ | 0,10 $ | Apr. 2026 | ||||
| StepFun | – | 250K | – | – | 32,6 %Terminal-Bench Hard | Apache 2.0 | 0,10 $ | 0,30 $ | Apr. 2026 |
Farbcodierung der Benchmark-Scores:
1. Die wichtigsten Benchmarks erklärt
Um die Open-Source-LLMs objektiv zu vergleichen, nutze ich drei zentrale Benchmark-Kategorien:
MMLU / MMLU-Pro: Der Massive Multitask Language Understanding Benchmark testet allgemeines Wissen über 57 Fächer hinweg (STEM, Sozialwissenschaften, Geisteswissenschaften). MMLU-Pro ist die anspruchsvollere Variante mit weniger Kontamination. Top-Modelle erreichen hier 85 bis 90 %.
MATH / GPQA: Diese Benchmarks testen mathematisches und wissenschaftliches Reasoning. MATH-500 enthält anspruchsvolle Mathematikaufgaben, während GPQA (Graduate-Level Google-Proof Q&A) Expertenwissen in Biologie, Physik und Chemie testet. Top-Modelle erreichen hier 70 bis 97 %.
HumanEval / LiveCodeBench: Diese Benchmarks testen Code-Generierung. HumanEval enthält Python-Programmieraufgaben, LiveCodeBench testet Code-Performance mit aktuellen, nicht kontaminierten Aufgaben. Top-Modelle erreichen hier 60 bis 90 %.
Die Tabelle zeigt pro Modell bis zu drei Benchmark-Scores; welcher Benchmark dahintersteckt, verrät das kleine Label unter dem Badge. Für ältere und Nischen-Modelle liegen nicht alle Scores vor, dort steht dann „–“.
Wie nah die offenen Spitzenmodelle den proprietären Flaggschiffen inzwischen kommen, zeigt der direkte Vergleich auf SWE-bench Verified:
Offene und proprietäre Modelle in derselben SWE-bench-Kohorte
Der Preisvergleich zeigt, wie viel Coding-Leistung die Modelle in genau dieser Kohorte pro API-Dollar liefern:
2. Die Top-Modelle im August 2026
Neu in der Auswahl ist GLM-5.3-Flash. Z.ai hat das Modell am 26. August 2026 unter MIT-Lizenz veröffentlicht. Das nativ multimodale MoE besitzt 320 Milliarden Gesamtparameter, davon sind 18 Milliarden pro Token aktiv. Das Kontextfenster umfasst 1 Million Token.
DeepSeek V4 Pro, veröffentlicht am 24. April 2026, ist der neue Spitzenreiter. Trotz 1,6 Billionen Gesamtparametern aktiviert das MoE-Modell pro Token nur einen kleinen Teil davon und kommt so mit etwa 27 % der Inferenz-FLOPs von V3.2 aus. In den wichtigsten Wissens- und Coding-Benchmarks liegt es unter den offenen Modellen fast überall vorn, die einzelnen Werte findest du in der Tabelle unten. Dazu kommen die gleiche MIT-Lizenz wie beim Rest der DeepSeek-Familie und ein natives 1M-Token-Kontextfenster.
Kimi K2.6 von Moonshot AI ist das zweitstärkste Open-Weight-Modell insgesamt und besonders stark bei Coding- und Mathe-Benchmarks. Außerdem versteht es nativ Video-Input. Es steht unter Modified MIT.
GLM-5.3-Flash von Z.ai verarbeitet Text, Bilder, Videos und Dateien und unterstützt bis zu 128.000 Output-Token. Z.ai meldet einen Wert von 84,3 auf Terminal-Bench 2.1 und 63,4 auf DeepSWE. Für einen direkten Vergleich müssen Prompt, Agent, Reasoning-Einstellung und Auswertung trotzdem identisch sein.
Qwen 3.8 Flash Next ist Alibabas Open-Weights-Variante vom 26. August 2026. Das multimodale Mixture-of-Experts-Modell kombiniert 125 Milliarden Parameter im Hauptmodell mit 51 Milliarden N-Gram-Embeddingparametern. Pro Token sind 6 Milliarden Parameter aktiv. Das native Kontextfenster umfasst 262.144 Token und lässt sich mit YaRN auf bis zu 1 Million Token erweitern. Die Gewichte stehen unter der Qwen Community License 1.0 und sind über die offizielle Modellseite verfügbar.
QwenCloud stellt dieses Modell über die API-Bezeichnung qwen3.8-flash bereit. Im Verzeichnis bleibt der Open-Weights-Eintrag deshalb klar von der API-Zeile für Qwen3.8 Flash getrennt. Der API-Preis wird nicht doppelt gezählt.
Kimi K2.5 hält weiterhin den HumanEval-Rekord aller Leaderboards mit 99,0 Punkten und führt auch MATH-500 an. Es ist das beste Open-Weight-Modell für reine Code-Generierung, wenn Latenz weniger wichtig ist als Spitzenqualität.
DeepSeek V4 Flash ist die kosteneffiziente Variante von V4 Pro (Parameter- und Aktivierungsdetails stehen in der Tabelle unten) und die praktischste Wahl, wenn du Spitzenklasse-Qualität auf einer einzelnen High-End-GPU willst.
Die vorherige Generation ist weiterhin sehr nutzbar: GPT-OSS-120B (OpenAIs erstes Open-Weight-Modell seit GPT-2), DeepSeek R1, Qwen3-235B-A22B-Thinking und Llama 4 Maverick bleiben stark, aber nicht mehr auf dem aktuellen Stand der Technik.
Hier noch einmal die sechs neuen Spitzenmodelle im direkten Überblick:
| Funktion | DeepSeek V4 Pro | Kimi K2.6 | GLM-5.3-Flash | Qwen 3.8 Flash Next | Kimi K2.5 | DeepSeek V4 Flash |
|---|---|---|---|---|---|---|
| Entwickler | DeepSeek | Moonshot AI | Z.ai | Alibaba | Moonshot AI | DeepSeek |
| LizenzNutzungsbedingungen prüfen | MIT | Modified MIT | MIT | Qwen Community License 1.0 | Modified MIT | MIT |
| Parameteralle Mixture-of-Experts | 1,6T (49B aktiv) | 1T | 320B (18B aktiv) | 125B + 51B N-Gram (6B aktiv) | 1T | 284B (13B aktiv) |
| Lokal nutzbarz. B. mit Ollama oder LM Studio | Ja | Ja | Ja | Ja | Ja | Ja |
| Hardware-Bedarf lokal | Multi-GPU oder quantisiert | Multi-GPU oder quantisiert | Multi-GPU oder quantisiert | Noch nicht pauschal angegeben | Multi-GPU oder quantisiert | Eine High-End-GPU |
| Besonderheit | Natives 1M-Token-Kontextfenster | 256K Kontext, nativer Video-Input | Bild-, Video- und Datei-Input, 1M Kontext | 262K Kontext, per YaRN bis 1M | Führt MATH-500 mit 98,0 | Kosteneffiziente Variante von V4 Pro |
3. LLM-Lizenzen erklärt
Hier findest du einen Überblick über die am häufigsten verwendeten Lizenzen bei Open-Source-LLMs.
MIT License
Eine sehr freizügige Open-Source-Lizenz, ähnlich wie Apache 2.0. Sie erlaubt die uneingeschränkte Nutzung, Modifikation und Weitergabe des LLMs, auch in proprietären Programmen, solange der Urheberrechtshinweis erhalten bleibt. DeepSeek V3 verwendet MIT mit einigen Einschränkungen für militärische Nutzung.
Llama 2 Community / Llama 3 Community
Unter den Lizenzen hat Meta Llama 2 und Llama 3 veröffentlicht. Sie erlauben die kostenlose Nutzung der LLMs für Forschung und kommerzielle Anwendungen mit bis zu 700 Millionen monatlich aktiven Nutzern. Der Quellcode und die Modellgewichte sind frei verfügbar.
Qwen License / Qianwen LICENSE
Die Qwen-Modelle werden unter verschiedenen Lizenzen veröffentlicht. Während kleinere Modelle oft unter Apache 2.0 lizenziert sind, haben größere Modelle wie Qwen2.5-72B spezielle Lizenzbedingungen, die kommerzielle Nutzung mit bestimmten Einschränkungen erlauben.
Apache 2.0
Eine sehr freizügige Open-Source-Lizenz, die nur minimale Beschränkungen vorsieht. Sie erlaubt die Nutzung, Modifikation und Weitergabe des LLMs, auch in proprietären Programmen, solange der Urheberrechtshinweis erhalten bleibt. Sie enthält keine Copyleft-Klausel.
CC BY-NC-4.0
Eine Creative-Commons-Lizenz, die es erlaubt, das LLM in jeglicher Form zu bearbeiten und zu teilen, jedoch nicht für kommerzielle Zwecke. Der Name des Urhebers muss genannt werden.
CC BY-NC-SA-4.0
Ähnlich wie CC BY-NC-4.0, jedoch mit der zusätzlichen Share-Alike-Bedingung. Das bedeutet, Forks oder bearbeitete Versionen eines LLMs müssen unter den gleichen Bedingungen weitergegeben werden.
nicht-kommerziell
Hier ist die Nutzung des LLMs für kommerzielle Zwecke untersagt. Was genau als „kommerziell“ gilt, ist aber nicht immer eindeutig definiert oder eingegrenzt.
Meistens sind „nicht-kommerzielle“ Modelle nur für Forschungszwecke oder zur privaten Nutzung freigegeben.
4. Open-Source-LLMs lokal auf dem eigenen Rechner nutzen
Open-Source-LLMs lokal auf dem eigenen Rechner zu nutzen, geht einfacher, als du vielleicht denkt:
1. Lade LM Studio herunter
Lade LM Studio von der Website herunter. Es ist kostenlos und für Mac, Windows und Linux verfügbar:

2. Installiere und öffne LM Studio
Im nächsten Schritt installierst du LM Studio auf deinem Rechner und öffnest es.
3. Lade gewünschte Open-Source-LLMs herunter
Jetzt musst du die Open-Source-LLMs in LM Studio herunterladen, die du nutzen möchtest.
Viele beliebte LLMs findest du bereits auf dem Startbildschirm. Um ein LLM herunterzuladen, klickst du einfach auf den blauen Download-Button:

Um bestimmte Open-Source-LLMs zu finden, kannst du auch die Suchfunktion nutzen:

4. Wichtig: Vor dem Download Systemvoraussetzungen beachten
Bevor du ein LLM herunterlädst, solltest du dir die Systemvoraussetzungen anschauen.
Llama 3 benötigt zum Beispiel mehr als 8 GB RAM und 4,92 GB freien Speicherplatz:

5. Mit dem Open-Source-LLM chatten
Nachdem du ein Open-Source-LLM heruntergeladen hast, kannst du es direkt in LM Studio nutzen.
Dazu klickst du einfach links in der Seitenleiste auf das Sprechblasen-Icon (?).
Die Benutzeroberfläche und die Einstellungsmöglichkeiten erinnern dabei an den OpenAI Playground:







