Zum Hauptinhalt springen

Die besten Open-Source-LLMs: 191 Modelle im Vergleich

Sortierbares Verzeichnis mit 191 Open-Source-LLMs: Benchmarks, Lizenzen, API-Preise, Kontextfenster. Plus: So nutzt du freie LLMs lokal auf dem PC.

FHFinn Hillebrandt
KI-Technik
Die besten Open-Source-LLMs: 191 Modelle im Vergleich
Mit * gekennzeichnete Links sind Affiliate-Links. Kommt über solche Links ein Kauf zustande, bekommen wir eine Provision.

Open-Source-LLMs sind einer der wichtigsten KI-Trends 2026.

Und das nicht zu Unrecht:

Open-Source-Modelle waren lange Zeit deutlich schwächer als proprietäre Modelle. Bis zum Frühjahr 2026 haben sie aber aufgeholt, vor allem dank chinesischer Labs:

DeepSeek V4 Pro, GLM-5.3-Flash von Z.ai, Kimi K2.6 von Moonshot AI, Qwen3.5 von Alibaba und das neue Qwen 3.8 Flash Next zeigen, wie nah offene Gewichte an proprietäre Spitzenmodelle herankommen. Für GLM-5.3-Flash veröffentlicht Z.ai unter anderem einen Wert von 84,3 auf Terminal-Bench 2.1 und 63,4 auf DeepSWE. Diese Herstellerwerte gehören jeweils zu ihrem dokumentierten Testaufbau und sind nicht automatisch mit unabhängigen Ranglisten vergleichbar.

In diesem Artikel findest du ein sortier- und filterbares Verzeichnis mit 191 Open-Source-LLMs, inklusive Benchmark-Scores, Lizenzen, API-Preisen, Kontextfenstern und Capabilities.

Wenn du auch proprietäre Spitzenmodelle einbeziehen möchtest, findest du im LLM-Vergleich 29 aktuelle Modelle mit gemeinsamen Benchmarks, Preisen und direkten Duellen.

Zudem zeige ich dir, wie du freie LLMs einfach und kostenlos auf deinem Rechner nutzen kannst (ohne programmieren oder das Terminal nutzen zu müssen).

TL;DRDas Wichtigste in Kürze
  • GLM-5.3-Flash ergänzt die Spitzengruppe mit 320 Milliarden Gesamtparametern, 18 Milliarden aktiven Parametern, nativer Multimodalität und MIT-Lizenz
  • Qwen 3.8 Flash Next ist ein multimodales MoE mit 125 Mrd. Hauptmodellparametern, 51 Mrd. N-Gram-Embeddingparametern und 6 Mrd. aktiven Parametern
  • 191 Open-Source-LLMs im filter- und sortierbaren Verzeichnis, von MIT und Apache 2.0 bis zu eingeschränkten Research-Lizenzen. Spalten wie Preise, Kontext und Capabilities lassen sich einzeln ein- und ausblenden
  • Chinesische Labs wie DeepSeek, Moonshot AI, Z.ai und Alibaba prägen die aktuelle Open-Weights-Spitzengruppe. Effiziente MoE-Modelle verbinden hohe Gesamtparameterzahlen mit deutlich weniger aktiven Parametern pro Token
  • Lokale Nutzung mit Tools wie Ollama, LM Studio oder GPT4All möglich, die neuen Top-Modelle brauchen aber ernsthafte Hardware (Multi-GPU oder quantisierte Varianten für Consumer-Rigs)

Alle Open-Source-LLMs im Überblick

Das Verzeichnis enthält alle Open-Weights-Modelle aus dem models.dev-Katalog plus kuratierte Klassiker, standardmäßig sortiert nach Release-Datum. Über „Spalten“ blendest du weitere Daten ein, etwa Modalitäten, Wissensstand, Max. Output oder die Zahl der API-Anbieter:

192 von 192 Modellen

Hy4 preview
Tencent1MTencent Hunyuan Community0,67 $2,00 $Aug. 2026
Alibaba125B (6B aktiv)256KQwen Community License 1.00,12 $0,40 $Aug. 2026
GLM-5.3-Flash
Z.ai320B (18B aktiv)1M63,4 %DeepSWEMIT0,015 $0,025 $Aug. 2026
DeepReinforce35B (3B aktiv)256KMIT0,10 $0,40 $Aug. 2026
Alibaba27B256K61,7 %SWE-bench ProApache 2.00,10 $0,40 $Aug. 2026
GLM-5.3
Z.ai1MMIT0,40 $1,40 $Aug. 2026
Alibaba256Kqwen3.8-max2,00 $6,00 $Aug. 2026
DeepSeek1MMIT0,35 $0,80 $Aug. 2026
Nemotron 3.5 Lightning 30B A3B
NVIDIA30B (3B aktiv)256KNVIDIA Open Model License0,050 $0,15 $Aug. 2026
Meta30B128K76 %SWE-Bench VerifiedApache 2.00,20 $0,80 $Aug. 2026
DeepSeek1M82,7 %Terminal-BenchMIT0,030 $0,10 $Juli 2026
thinkingmachines1MApache-2.00,45 $1,20 $Juli 2026
Laguna S 2.1
Poolside1M0,090 $0,18 $Juli 2026
Kimi K3
Moonshot AI1M88,3 %Terminal-Bench2,00 $8,00 $Juli 2026
thinkingmachines1MApache-2.00,95 $4,05 $Juli 2026
Tencent250K78 %SWE-Bench VerifiedTencent Hunyuan Community0,066 $0,26 $Juli 2026
Poolside33B (3B aktiv)256K70,9 %SWE-Bench VerifiedOpenMDW-1.10,060 $0,12 $Juli 2026
Ornith 1.0 31B
DeepReinforce31B256KMITJuni 2026
DeepReinforce35B256K75,6 %SWE-Bench VerifiedMITJuni 2026
DeepReinforce397B256K82,4 %SWE-Bench VerifiedMITJuni 2026
DeepReinforce9B256K69,4 %SWE-Bench VerifiedMITJuni 2026
Z.ai1M91,2 %GPQA62,1 %SWE-Bench ProMIT0,30 $1,05 $Juni 2026
Moonshot AI1T (32B aktiv)256K89,6 %GPQA67,4 %Terminal-BenchModified MIT0,28 $1,10 $Juni 2026
Moonshot AI1T (32B aktiv)256K89,6 %GPQA67,4 %Terminal-BenchModified MIT1,90 $8,00 $Juni 2026
North Mini Code
Cohere250K61 %SWE-Bench VerifiedJuni 2026
Xiaomi1MMIT1,31 $2,61 $Juni 2026
Nemotron 3 Ultra 550B A55B
NVIDIA550B (55B aktiv)1M86,8 %MMLU-Pro87 %GPQA89 %LiveCodeBenchNVIDIA Open Model License0,10 $0,10 $Juni 2026
MiniMax1M92,9 %GPQA80,5 %SWE-Bench VerifiedMIT0,23 $0,90 $Juni 2026
StepFun250K76,5 %SWE-Bench VerifiedApache 2.00,19 $1,11 $Mai 2026
Command A Plus
Cohere125KCC BY-NC-4.02,50 $10,00 $Mai 2026
openbmb1B128Kapache-2.00,12 $0,74 $Mai 2026
Mistral AI128B256K77,6 %SWE-Bench Verified1,39 $6,90 $Apr. 2026
Nemotron 3 Nano Omni 30B A3B Reasoning
NVIDIA30B (3B aktiv)250K77,3 %MMLU-Pro72,2 %GPQA63,2 %LiveCodeBenchNVIDIA Open Model License0,11 $0,42 $Apr. 2026
Poolside225B (23B aktiv)256K74,6 %SWE-Bench VerifiedApache 2.0Apr. 2026
Poolside33B (3B aktiv)256K69,9 %SWE-Bench VerifiedApache 2.0Apr. 2026
DeepSeek284B (13B aktiv)1M83 %MMLU-Pro85 %GPQA88 %LiveCodeBenchMIT0,050 $0,10 $Apr. 2026
DeepSeek1,6T (49B aktiv)1M87,5 %MMLU-Pro90,1 %GPQA93,5 %LiveCodeBenchMIT0,35 $0,70 $Apr. 2026
DeepSeek V4 Pro 0423
DeepSeek1MMIT1,32 $3,30 $Apr. 2026
Alibaba27B256K86,2 %MMLU-Pro87,8 %GPQA77,2 %SWE-Bench VerifiedApache 2.00,20 $0,60 $Apr. 2026
Xiaomi310B (15B aktiv)1M86,3 %MMLU56,1 %SWE-Bench ProMIT0,14 $0,28 $Apr. 2026
Xiaomi1M89,4 %MMLU78,9 %SWE-Bench VerifiedMIT0,40 $0,80 $Apr. 2026
Moonshot AI1T (32B aktiv)256K84,6 %MMLU-Pro90,5 %GPQA92 %HumanEvalModified MIT0,22 $1,10 $Apr. 2026
Tencent250K87,4 %MMLU87,2 %GPQA74,4 %SWE-Bench VerifiedTencent Hunyuan Community0,066 $0,26 $Apr. 2026
Alibaba35B (3B aktiv)256K85,2 %MMLU-Pro86 %GPQA73,4 %SWE-Bench VerifiedApache 2.00,070 $0,42 $Apr. 2026
Z.ai754B200K91,7 %MMLU85,7 %GPQA58,4 %SWE-Bench ProMIT0,45 $2,15 $Apr. 2026
Google26B (4B aktiv)256K82,6 %MMLU-Pro82,3 %GPQA77,1 %LiveCodeBenchGemma Terms of Use0,042 $0,22 $Apr. 2026
Google31B256K85,2 %MMLU-Pro84,3 %GPQA80 %LiveCodeBenchGemma Terms of Use0,090 $0,30 $Apr. 2026
Google128K60 %MMLU-Pro43,4 %GPQA44 %LiveCodeBenchGemma Terms of Use0,020 $0,10 $Apr. 2026
Google128K69,4 %MMLU-Pro58,6 %GPQA52 %LiveCodeBenchGemma Terms of Use0,020 $0,10 $Apr. 2026
StepFun250K32,6 %Terminal-Bench HardApache 2.00,10 $0,30 $Apr. 2026

Farbcodierung der Benchmark-Scores:

ExzellentTop-Bereich
GutÜberdurchschnittlich
DurchschnittSolide
SchwachUnterdurchschnittlich

1. Die wichtigsten Benchmarks erklärt

Um die Open-Source-LLMs objektiv zu vergleichen, nutze ich drei zentrale Benchmark-Kategorien:

MMLU / MMLU-Pro: Der Massive Multitask Language Understanding Benchmark testet allgemeines Wissen über 57 Fächer hinweg (STEM, Sozialwissenschaften, Geisteswissenschaften). MMLU-Pro ist die anspruchsvollere Variante mit weniger Kontamination. Top-Modelle erreichen hier 85 bis 90 %.

MATH / GPQA: Diese Benchmarks testen mathematisches und wissenschaftliches Reasoning. MATH-500 enthält anspruchsvolle Mathematikaufgaben, während GPQA (Graduate-Level Google-Proof Q&A) Expertenwissen in Biologie, Physik und Chemie testet. Top-Modelle erreichen hier 70 bis 97 %.

HumanEval / LiveCodeBench: Diese Benchmarks testen Code-Generierung. HumanEval enthält Python-Programmieraufgaben, LiveCodeBench testet Code-Performance mit aktuellen, nicht kontaminierten Aufgaben. Top-Modelle erreichen hier 60 bis 90 %.

Die Tabelle zeigt pro Modell bis zu drei Benchmark-Scores; welcher Benchmark dahintersteckt, verrät das kleine Label unter dem Badge. Für ältere und Nischen-Modelle liegen nicht alle Scores vor, dort steht dann „–“.

Wie nah die offenen Spitzenmodelle den proprietären Flaggschiffen inzwischen kommen, zeigt der direkte Vergleich auf SWE-bench Verified:

Offene und proprietäre Modelle in derselben SWE-bench-Kohorte

Modelle:
DeepSeek V4 Pro
Kimi K2.6
Claude Fable 5
Claude Opus 4.8
GPT-5.5
Gemini 3.1 Pro
Quelle: Vals AI, SWE-bench Verified
gradually.ai

Der Preisvergleich zeigt, wie viel Coding-Leistung die Modelle in genau dieser Kohorte pro API-Dollar liefern:

Preis und SWE-bench-Leistung offener und proprietärer Modelle
Ideal: stark + günstig
DeepSeek
Moonshot AI
Anthropic
OpenAI
Google
Effizienz-Grenze (beste Preis-Leistung)
Quellen: Vals AI, offizielle API-Preise
gradually.ai

2. Die Top-Modelle im August 2026

Neu in der Auswahl ist GLM-5.3-Flash. Z.ai hat das Modell am 26. August 2026 unter MIT-Lizenz veröffentlicht. Das nativ multimodale MoE besitzt 320 Milliarden Gesamtparameter, davon sind 18 Milliarden pro Token aktiv. Das Kontextfenster umfasst 1 Million Token.

DeepSeek V4 Pro, veröffentlicht am 24. April 2026, ist der neue Spitzenreiter. Trotz 1,6 Billionen Gesamtparametern aktiviert das MoE-Modell pro Token nur einen kleinen Teil davon und kommt so mit etwa 27 % der Inferenz-FLOPs von V3.2 aus. In den wichtigsten Wissens- und Coding-Benchmarks liegt es unter den offenen Modellen fast überall vorn, die einzelnen Werte findest du in der Tabelle unten. Dazu kommen die gleiche MIT-Lizenz wie beim Rest der DeepSeek-Familie und ein natives 1M-Token-Kontextfenster.

Kimi K2.6 von Moonshot AI ist das zweitstärkste Open-Weight-Modell insgesamt und besonders stark bei Coding- und Mathe-Benchmarks. Außerdem versteht es nativ Video-Input. Es steht unter Modified MIT.

GLM-5.3-Flash von Z.ai verarbeitet Text, Bilder, Videos und Dateien und unterstützt bis zu 128.000 Output-Token. Z.ai meldet einen Wert von 84,3 auf Terminal-Bench 2.1 und 63,4 auf DeepSWE. Für einen direkten Vergleich müssen Prompt, Agent, Reasoning-Einstellung und Auswertung trotzdem identisch sein.

Qwen 3.8 Flash Next ist Alibabas Open-Weights-Variante vom 26. August 2026. Das multimodale Mixture-of-Experts-Modell kombiniert 125 Milliarden Parameter im Hauptmodell mit 51 Milliarden N-Gram-Embeddingparametern. Pro Token sind 6 Milliarden Parameter aktiv. Das native Kontextfenster umfasst 262.144 Token und lässt sich mit YaRN auf bis zu 1 Million Token erweitern. Die Gewichte stehen unter der Qwen Community License 1.0 und sind über die offizielle Modellseite verfügbar.

QwenCloud stellt dieses Modell über die API-Bezeichnung qwen3.8-flash bereit. Im Verzeichnis bleibt der Open-Weights-Eintrag deshalb klar von der API-Zeile für Qwen3.8 Flash getrennt. Der API-Preis wird nicht doppelt gezählt.

Kimi K2.5 hält weiterhin den HumanEval-Rekord aller Leaderboards mit 99,0 Punkten und führt auch MATH-500 an. Es ist das beste Open-Weight-Modell für reine Code-Generierung, wenn Latenz weniger wichtig ist als Spitzenqualität.

DeepSeek V4 Flash ist die kosteneffiziente Variante von V4 Pro (Parameter- und Aktivierungsdetails stehen in der Tabelle unten) und die praktischste Wahl, wenn du Spitzenklasse-Qualität auf einer einzelnen High-End-GPU willst.

Die vorherige Generation ist weiterhin sehr nutzbar: GPT-OSS-120B (OpenAIs erstes Open-Weight-Modell seit GPT-2), DeepSeek R1, Qwen3-235B-A22B-Thinking und Llama 4 Maverick bleiben stark, aber nicht mehr auf dem aktuellen Stand der Technik.

Hier noch einmal die sechs neuen Spitzenmodelle im direkten Überblick:

FunktionDeepSeek V4 ProKimi K2.6GLM-5.3-FlashQwen 3.8 Flash NextKimi K2.5DeepSeek V4 Flash
EntwicklerDeepSeekMoonshot AIZ.aiAlibabaMoonshot AIDeepSeek
LizenzNutzungsbedingungen prüfenMITModified MITMITQwen Community License 1.0Modified MITMIT
Parameteralle Mixture-of-Experts1,6T (49B aktiv)1T320B (18B aktiv)125B + 51B N-Gram (6B aktiv)1T284B (13B aktiv)
Lokal nutzbarz. B. mit Ollama oder LM StudioJaJaJaJaJaJa
Hardware-Bedarf lokalMulti-GPU oder quantisiertMulti-GPU oder quantisiertMulti-GPU oder quantisiertNoch nicht pauschal angegebenMulti-GPU oder quantisiertEine High-End-GPU
BesonderheitNatives 1M-Token-Kontextfenster256K Kontext, nativer Video-InputBild-, Video- und Datei-Input, 1M Kontext262K Kontext, per YaRN bis 1MFührt MATH-500 mit 98,0Kosteneffiziente Variante von V4 Pro
JaTeilweiseNein

3. LLM-Lizenzen erklärt

Hier findest du einen Überblick über die am häufigsten verwendeten Lizenzen bei Open-Source-LLMs.

MIT License

Eine sehr freizügige Open-Source-Lizenz, ähnlich wie Apache 2.0. Sie erlaubt die uneingeschränkte Nutzung, Modifikation und Weitergabe des LLMs, auch in proprietären Programmen, solange der Urheberrechtshinweis erhalten bleibt. DeepSeek V3 verwendet MIT mit einigen Einschränkungen für militärische Nutzung.

Llama 2 Community / Llama 3 Community

Unter den Lizenzen hat Meta Llama 2 und Llama 3 veröffentlicht. Sie erlauben die kostenlose Nutzung der LLMs für Forschung und kommerzielle Anwendungen mit bis zu 700 Millionen monatlich aktiven Nutzern. Der Quellcode und die Modellgewichte sind frei verfügbar.

Qwen License / Qianwen LICENSE

Die Qwen-Modelle werden unter verschiedenen Lizenzen veröffentlicht. Während kleinere Modelle oft unter Apache 2.0 lizenziert sind, haben größere Modelle wie Qwen2.5-72B spezielle Lizenzbedingungen, die kommerzielle Nutzung mit bestimmten Einschränkungen erlauben.

Apache 2.0

Eine sehr freizügige Open-Source-Lizenz, die nur minimale Beschränkungen vorsieht. Sie erlaubt die Nutzung, Modifikation und Weitergabe des LLMs, auch in proprietären Programmen, solange der Urheberrechtshinweis erhalten bleibt. Sie enthält keine Copyleft-Klausel.

CC BY-NC-4.0

Eine Creative-Commons-Lizenz, die es erlaubt, das LLM in jeglicher Form zu bearbeiten und zu teilen, jedoch nicht für kommerzielle Zwecke. Der Name des Urhebers muss genannt werden.

CC BY-NC-SA-4.0

Ähnlich wie CC BY-NC-4.0, jedoch mit der zusätzlichen Share-Alike-Bedingung. Das bedeutet, Forks oder bearbeitete Versionen eines LLMs müssen unter den gleichen Bedingungen weitergegeben werden.

nicht-kommerziell

Hier ist die Nutzung des LLMs für kommerzielle Zwecke untersagt. Was genau als „kommerziell“ gilt, ist aber nicht immer eindeutig definiert oder eingegrenzt.

Meistens sind „nicht-kommerzielle“ Modelle nur für Forschungszwecke oder zur privaten Nutzung freigegeben.

4. Open-Source-LLMs lokal auf dem eigenen Rechner nutzen

Open-Source-LLMs lokal auf dem eigenen Rechner zu nutzen, geht einfacher, als du vielleicht denkt:

1. Lade LM Studio herunter

Lade LM Studio von der Website herunter. Es ist kostenlos und für Mac, Windows und Linux verfügbar:

LM Studio

2. Installiere und öffne LM Studio

Im nächsten Schritt installierst du LM Studio auf deinem Rechner und öffnest es.

3. Lade gewünschte Open-Source-LLMs herunter

Jetzt musst du die Open-Source-LLMs in LM Studio herunterladen, die du nutzen möchtest.

Viele beliebte LLMs findest du bereits auf dem Startbildschirm. Um ein LLM herunterzuladen, klickst du einfach auf den blauen Download-Button:

Open-Source-LLMs herunterladen

Um bestimmte Open-Source-LLMs zu finden, kannst du auch die Suchfunktion nutzen:

Open-Source-LLMs suchen

4. Wichtig: Vor dem Download Systemvoraussetzungen beachten

Bevor du ein LLM herunterlädst, solltest du dir die Systemvoraussetzungen anschauen.

Llama 3 benötigt zum Beispiel mehr als 8 GB RAM und 4,92 GB freien Speicherplatz:

Open-Source-LLM Systemvoraussetzungen

5. Mit dem Open-Source-LLM chatten

Nachdem du ein Open-Source-LLM heruntergeladen hast, kannst du es direkt in LM Studio nutzen.

Dazu klickst du einfach links in der Seitenleiste auf das Sprechblasen-Icon (?).

Die Benutzeroberfläche und die Einstellungsmöglichkeiten erinnern dabei an den OpenAI Playground:

Mit Open-Source-LLM chatten

Häufig gestellte Fragen zu Open-Source-LLMs

FH

Finn Hillebrandt

KI-Experte & Blogger

Finn Hillebrandt ist der Gründer von Gradually AI, SEO- und KI-Experte. Er hilft Online-Unternehmern, ihre Prozesse und ihr Marketing mit KI zu vereinfachen und zu automatisieren. Finn teilt sein Wissen hier auf dem Blog in 50+ Fachartikeln sowie über den KI Business Club.

Erfahre mehr über Finn und das Team, folge Finn bei LinkedIn, tritt seiner Facebook-Gruppe zu ChatGPT, OpenAI & KI-Tools bei oder mache es wie 17.500+ andere und abonniere seinen KI-Newsletter mit Tipps, News und Angeboten rund um KI-Tools und Online-Business. Besuche auch seinen anderen Blog, Blogmojo, auf dem es um WordPress, Bloggen und SEO geht.