Zum Hauptinhalt springen

Die besten Open-Source-LLMs: 120+ Modelle im Vergleich

Sortierbares Verzeichnis mit über 120 Open-Source-LLMs: Benchmarks, Lizenzen, API-Preise, Kontextfenster. Plus: So nutzt du freie LLMs lokal auf dem PC.

FHFinn Hillebrandt
KI-Technik
Die besten Open-Source-LLMs: 120+ Modelle im Vergleich
Mit * gekennzeichnete Links sind Affiliate-Links. Kommt über solche Links ein Kauf zustande, bekommen wir eine Provision.

Open-Source-LLMs sind einer der wichtigsten KI-Trends 2026.

Und das nicht zu Unrecht:

Open-Source-Modelle waren lange Zeit deutlich schwächer als proprietäre Modelle. Bis zum Frühjahr 2026 haben sie aber aufgeholt, vor allem dank chinesischer Labs:

DeepSeek V4 Pro (Release am 24. April 2026), GLM-5.1 von Z.ai, Kimi K2.6 von Moonshot AI und Qwen3.5 von Alibaba können sich mit den besten proprietären LLMs wie Claude Opus 4.8, GPT-5.5 oder Gemini 3.1 Pro messen und schlagen sie in manchen Benchmarks wie SWE-Bench Pro und HumanEval sogar. Die neue proprietäre Referenz für Terminal-Bench 2.1 ist GPT-5.6 Sol (allgemein verfügbar seit 09.07.2026, Standardmodell in OpenAI Codex) mit 88,8 %, Sol Ultra 91,9 %. Sol liegt auf SWE-Bench Pro bei 64,6 % (rund 15 Punkte hinter Claude Mythos 5 und Fable 5). Vergleichbare Open-Source-Werte auf Terminal-Bench 2.1 stehen noch aus.

In diesem Artikel findest du ein sortier- und filterbares Verzeichnis mit über 120 Open-Source-LLMs, inklusive Benchmark-Scores, Lizenzen, API-Preisen, Kontextfenstern und Capabilities.

Zudem zeige ich dir, wie du freie LLMs einfach und kostenlos auf deinem Rechner nutzen kannst (ohne programmieren oder das Terminal nutzen zu müssen).

TL;DRDas Wichtigste in Kürze
  • DeepSeek V4 Pro (1,6T MoE, MIT, April 2026), Kimi K2.6 (1T MoE) und GLM-5.1 von Z.ai führen die April-2026-Rankings an, GLM-5.1 toppt SWE-Bench Pro mit 58,4 %
  • Über 120 Open-Source-LLMs im filter- und sortierbaren Verzeichnis, von MIT und Apache 2.0 bis zu eingeschränkten Research-Lizenzen. Spalten wie Preise, Kontext und Capabilities lassen sich einzeln ein- und ausblenden
  • Chinesische Labs (DeepSeek, Moonshot AI, Z.ai, Alibaba) belegen die meisten Spitzenplätze. Die Leader von 2025 (GPT-OSS-120B, DeepSeek R1, Qwen3-235B, Llama 4) sind weiterhin solide, aber nicht mehr ganz vorn
  • Lokale Nutzung mit Tools wie Ollama, LM Studio oder GPT4All möglich, die neuen Top-Modelle brauchen aber ernsthafte Hardware (Multi-GPU oder quantisierte Varianten für Consumer-Rigs)

Alle Open-Source-LLMs im Überblick

Das Verzeichnis enthält alle Open-Weights-Modelle aus dem models.dev-Katalog plus kuratierte Klassiker, standardmäßig sortiert nach Release-Datum. Über „Spalten“ blendest du weitere Daten ein, etwa Modalitäten, Wissensstand, Max. Output oder die Zahl der API-Anbieter:

130 von 130 Modellen

Poolside33B (3B aktiv)256K70,9 %SWE-Bench VerifiedOpenMDW-1.10,060 $0,12 $Juli 2026
Ornith 1.0 31B
DeepReinforce31B256KMITJuni 2026
DeepReinforce35B256K75,6 %SWE-Bench VerifiedMITJuni 2026
DeepReinforce397B256K82,4 %SWE-Bench VerifiedMITJuni 2026
DeepReinforce9B256K69,4 %SWE-Bench VerifiedMITJuni 2026
Z.ai1M91,2 %GPQA62,1 %SWE-Bench ProMIT0,42 $1,32 $Juni 2026
Moonshot AI1T (32B aktiv)256K89,6 %GPQA67,4 %Terminal-BenchModified MIT0,28 $1,10 $Juni 2026
Moonshot AI1T (32B aktiv)256K89,6 %GPQA67,4 %Terminal-BenchModified MIT1,90 $8,00 $Juni 2026
North Mini Code
Cohere250K61 %SWE-Bench VerifiedJuni 2026
Xiaomi1MMIT1,31 $2,61 $Juni 2026
Nemotron 3 Ultra 550B A55B
NVIDIA550B (55B aktiv)1M86,8 %MMLU-Pro87 %GPQA89 %LiveCodeBenchNVIDIA Open Model License0,10 $0,10 $Juni 2026
MiniMax500K92,9 %GPQA80,5 %SWE-Bench VerifiedMIT0,28 $1,10 $Juni 2026
StepFun250K76,5 %SWE-Bench VerifiedApache 2.00,20 $1,15 $Mai 2026
Command A Plus
Cohere125KCC BY-NC-4.02,50 $10,00 $Mai 2026
Mistral AI128B256K77,6 %SWE-Bench Verified1,50 $6,90 $Apr. 2026
Nemotron 3 Nano Omni 30B A3B Reasoning
NVIDIA30B (3B aktiv)250K77,3 %MMLU-Pro72,2 %GPQA63,2 %LiveCodeBenchNVIDIA Open Model License0,11 $0,42 $Apr. 2026
Poolside225B (23B aktiv)256K74,6 %SWE-Bench VerifiedApache 2.00,20 $0,40 $Apr. 2026
Poolside33B (3B aktiv)256K69,9 %SWE-Bench VerifiedApache 2.00,20 $0,40 $Apr. 2026
DeepSeek284B (13B aktiv)1M83 %MMLU-Pro85 %GPQA88 %LiveCodeBenchMIT0,084 $0,17 $Apr. 2026
DeepSeek1,6T (49B aktiv)1M87,5 %MMLU-Pro90,1 %GPQA93,5 %LiveCodeBenchMIT0,35 $0,70 $Apr. 2026
Alibaba27B256K86,2 %MMLU-Pro87,8 %GPQA77,2 %SWE-Bench VerifiedApache 2.00,20 $0,76 $Apr. 2026
Xiaomi1M86,3 %MMLU56,1 %SWE-Bench ProMIT0,11 $0,28 $Apr. 2026
Xiaomi1M89,4 %MMLU78,9 %SWE-Bench VerifiedMIT0,40 $0,80 $Apr. 2026
Moonshot AI1T (32B aktiv)256K84,6 %MMLU-Pro90,5 %GPQA92 %HumanEvalModified MIT0,28 $1,10 $Apr. 2026
Tencent250K87,4 %MMLU87,2 %GPQA74,4 %SWE-Bench VerifiedTencent Hunyuan Community0,063 $0,21 $Apr. 2026
Alibaba35B (3B aktiv)256K85,2 %MMLU-Pro86 %GPQA73,4 %SWE-Bench VerifiedApache 2.00,11 $0,48 $Apr. 2026
Z.ai754B200K91,7 %MMLU85,7 %GPQA58,4 %SWE-Bench ProMIT0,30 $2,15 $Apr. 2026
Google26B (4B aktiv)256K82,6 %MMLU-Pro82,3 %GPQA77,1 %LiveCodeBenchGemma Terms of Use0,060 $0,30 $Apr. 2026
Google31B256K85,2 %MMLU-Pro84,3 %GPQA80 %LiveCodeBenchGemma Terms of Use0,10 $0,30 $Apr. 2026
Google128K60 %MMLU-Pro43,4 %GPQA44 %LiveCodeBenchGemma Terms of UseApr. 2026
Google128K69,4 %MMLU-Pro58,6 %GPQA52 %LiveCodeBenchGemma Terms of UseApr. 2026
StepFun250K32,6 %Terminal-Bench HardApache 2.00,10 $0,30 $Apr. 2026
Nemotron Cascade 2 30B A3B
NVIDIA30B (3B aktiv)250K79,8 %MMLU-Pro76,1 %GPQA87,2 %LiveCodeBenchNVIDIA Open Model License0,14 $0,60 $März 2026
MiniMax200K81,8 %MMLU-Pro89,8 %GPQA79,9 %SWE-Bench VerifiedMIT0,24 $0,96 $März 2026
MiniMax200K81,8 %MMLU-Pro89,8 %GPQA79,9 %SWE-Bench VerifiedMIT0,60 $2,40 $März 2026
Mistral AI119B250K71,2 %GPQA17,4 %Terminal-Bench HardApache 2.00,15 $0,60 $März 2026
Nemotron VoiceChat
NVIDIA125KNVIDIA Open Model LicenseMärz 2026
Nemotron 3 Super 120B A12B
NVIDIA120B (12B aktiv)256K83,7 %MMLU-Pro79,2 %GPQA81,2 %LiveCodeBenchNVIDIA Open Model License0,050 $0,25 $März 2026
Alibaba122B (10B aktiv)256K86,7 %MMLU-Pro86,6 %GPQA72 %SWE-Bench VerifiedApache 2.00,12 $0,92 $Feb. 2026
Alibaba27B256K86,1 %MMLU-Pro85,5 %GPQA72,4 %SWE-Bench VerifiedApache 2.00,086 $0,69 $Feb. 2026
Alibaba35B (3B aktiv)256K85,3 %MMLU-Pro84,2 %GPQA74,6 %LiveCodeBenchApache 2.00,057 $0,46 $Feb. 2026
Alibaba9B256K82,5 %MMLU-Pro81,7 %GPQA65,6 %LiveCodeBenchApache 2.00,040 $0,15 $Feb. 2026
Sarvam 30B
Sarvam AI30B125K85,1 %MMLU66,5 %GPQA70 %LiveCodeBench0,020 $0,10 $Feb. 2026
Alibaba397B (17B aktiv)256K87,8 %MMLU-Pro88,4 %GPQA76,4 %SWE-Bench VerifiedApache 2.00,17 $1,03 $Feb. 2026
MiniMax200K85,2 %MMLU-Pro85,2 %GPQA75,8 %SWE-Bench VerifiedMIT0,60 $2,40 $Feb. 2026
MiniMax200K85,2 %MMLU-Pro85,2 %GPQA75,8 %SWE-Bench VerifiedMIT0,11 $0,88 $Feb. 2026
Z.ai744B200K96 %MMLU94 %GPQA94,2 %HumanEvalMIT0,30 $1,90 $Feb. 2026
StepFun250K84,4 %MMLU-Pro83,5 %GPQA74,4 %SWE-Bench VerifiedApache 2.00,090 $0,30 $Jan. 2026
Z.ai200K75,2 %GPQA59,2 %SWE-Bench VerifiedMIT0,040 $0,30 $Jan. 2026
Z.ai200K75,2 %GPQA59,2 %SWE-Bench VerifiedMIT0,060 $0,40 $Jan. 2026

Farbcodierung der Benchmark-Scores:

ExzellentTop-Bereich
GutÜberdurchschnittlich
DurchschnittSolide
SchwachUnterdurchschnittlich

1. Die wichtigsten Benchmarks erklärt

Um die Open-Source-LLMs objektiv zu vergleichen, nutze ich drei zentrale Benchmark-Kategorien:

MMLU / MMLU-Pro: Der Massive Multitask Language Understanding Benchmark testet allgemeines Wissen über 57 Fächer hinweg (STEM, Sozialwissenschaften, Geisteswissenschaften). MMLU-Pro ist die anspruchsvollere Variante mit weniger Kontamination. Top-Modelle erreichen hier 85 bis 90 %.

MATH / GPQA: Diese Benchmarks testen mathematisches und wissenschaftliches Reasoning. MATH-500 enthält anspruchsvolle Mathematikaufgaben, während GPQA (Graduate-Level Physics Questions Answers) Expertenwissen in Biologie, Physik und Chemie testet. Top-Modelle erreichen hier 70 bis 97 %.

HumanEval / LiveCodeBench: Diese Benchmarks testen Code-Generierung. HumanEval enthält Python-Programmieraufgaben, LiveCodeBench testet Code-Performance mit aktuellen, nicht kontaminierten Aufgaben. Top-Modelle erreichen hier 60 bis 90 %.

Die Tabelle zeigt pro Modell bis zu drei Benchmark-Scores; welcher Benchmark dahintersteckt, verrät das kleine Label unter dem Badge. Für ältere und Nischen-Modelle liegen nicht alle Scores vor, dort steht dann „–“.

Wie nah die offenen Spitzenmodelle den proprietären Flaggschiffen inzwischen kommen, zeigt der direkte Vergleich auf SWE-bench Verified:

Offene Modelle nur rund 8 Punkte hinter GPT-5.5 und Opus 4.8

Modelle:
DeepSeek V4 Pro
Kimi K2.6
Claude Opus 4.8
GPT-5.5
Gemini 3.1 Pro
Quellen: DeepSeek, Moonshot AI, Anthropic, OpenAI, Google DeepMind
|
CC BY 4.0
gradually.ai

Noch deutlicher wird der Unterschied beim Preis. Die offenen Spitzenmodelle liefern fast die gleiche Coding-Leistung für einen Bruchteil der API-Kosten:

DeepSeek V4 Pro und Kimi K2.6: beste Preis-Leistung im Scatter
Ideal: stark + günstig
DeepSeek
Moonshot AI
Anthropic
OpenAI
Google
Effizienz-Grenze (beste Preis-Leistung)
Quellen: Offizielle API-Preislisten von DeepSeek, Moonshot AI, Anthropic, OpenAI und Google
|
CC BY 4.0
gradually.ai

2. Die Top-Modelle im April 2026

DeepSeek V4 Pro (Release am 24. April 2026) ist der neue Spitzenreiter. Das 1,6 Billionen Parameter MoE aktiviert nur 49B pro Token, erreicht 87,5 % auf MMLU-Pro, 90,1 % auf GPQA Diamond und 93,5 % auf LiveCodeBench. Gleiche MIT-Lizenz wie der Rest der DeepSeek-Familie und natives 1M-Token-Kontextfenster mit etwa 27 % der Inferenz-FLOPs von V3.2.

Kimi K2.6 von Moonshot AI ist das zweitstärkste Open-Weight-Modell insgesamt: 92 % auf HumanEval, 90,5 % auf GPQA Diamond, 96,4 % auf AIME 2026, mit 256K Kontextfenster und nativem Video-Input. Modified MIT, 1T Parameter MoE.

GLM-5.1 von Z.ai (vormals Zhipu) toppt SWE-Bench Pro mit 58,4 % und schlägt damit GPT-5.4 (57,7 %) und Claude Opus 4.6 (57,3 %). Das 754B-Parameter-MoE wurde komplett auf Huawei-Ascend-Chips trainiert und läuft unter MIT-Lizenz. Die Reasoning-Variante GLM-5 erreicht 96 % auf MMLU und 94 % auf GPQA, die höchsten Knowledge-Scores im Open-Source-Bereich.

Kimi K2.5 hält weiterhin den HumanEval-Rekord aller Leaderboards (99,0) und führt MATH-500 (98,0). Das beste Open-Weight-Modell für reine Code-Generierung, wenn Latenz weniger wichtig ist als Spitzenqualität.

DeepSeek V4 Flash (284B / 13B aktiv) ist die kosteneffiziente Variante von V4 Pro und die praktischste Wahl, wenn du Spitzenklasse-Qualität auf einer einzelnen High-End-GPU willst.

Die vorherige Generation ist weiterhin sehr nutzbar: GPT-OSS-120B (OpenAIs erstes Open-Weight-Modell seit GPT-2), DeepSeek R1, Qwen3-235B-A22B-Thinking und Llama 4 Maverick bleiben stark, aber nicht mehr auf dem aktuellen Stand der Technik.

Hier noch einmal die fünf neuen Spitzenmodelle im direkten Überblick:

FunktionDeepSeek V4 ProKimi K2.6GLM-5.1Kimi K2.5DeepSeek V4 Flash
EntwicklerDeepSeekMoonshot AIZ.aiMoonshot AIDeepSeek
Lizenzalle permissivMITModified MITMITModified MITMIT
Parameteralle Mixture-of-Experts1,6T (49B aktiv)1T754B1T284B (13B aktiv)
Lokal nutzbarz. B. mit Ollama oder LM StudioJaJaJaJaJa
Hardware-Bedarf lokalMulti-GPU oder quantisiertMulti-GPU oder quantisiertMulti-GPU oder quantisiertMulti-GPU oder quantisiertEine High-End-GPU
BesonderheitNatives 1M-Token-Kontextfenster256K Kontext, nativer Video-InputKomplett auf Huawei-Ascend-Chips trainiertFührt MATH-500 mit 98,0Kosteneffiziente Variante von V4 Pro
JaTeilweiseNein

3. LLM-Lizenzen erklärt

Hier findest du einen Überblick über die am häufigsten verwendeten Lizenzen bei Open-Source-LLMs.

MIT License

Eine sehr freizügige Open-Source-Lizenz, ähnlich wie Apache 2.0. Sie erlaubt die uneingeschränkte Nutzung, Modifikation und Weitergabe des LLMs, auch in proprietären Programmen, solange der Urheberrechtshinweis erhalten bleibt. DeepSeek V3 verwendet MIT mit einigen Einschränkungen für militärische Nutzung.

Llama 2 Community / Llama 3 Community

Unter den Lizenzen hat Meta Llama 2 und Llama 3 veröffentlicht. Sie erlauben die kostenlose Nutzung der LLMs für Forschung und kommerzielle Anwendungen mit bis zu 700 Millionen monatlich aktiven Nutzern. Der Quellcode und die Modellgewichte sind frei verfügbar.

Qwen License / Qianwen LICENSE

Die Qwen-Modelle werden unter verschiedenen Lizenzen veröffentlicht. Während kleinere Modelle oft unter Apache 2.0 lizenziert sind, haben größere Modelle wie Qwen2.5-72B spezielle Lizenzbedingungen, die kommerzielle Nutzung mit bestimmten Einschränkungen erlauben.

Apache 2.0

Eine sehr freizügige Open-Source-Lizenz, die nur minimale Beschränkungen vorsieht. Sie erlaubt die Nutzung, Modifikation und Weitergabe des LLMs, auch in proprietären Programmen, solange der Urheberrechtshinweis erhalten bleibt. Sie enthält keine Copyleft-Klausel.

CC BY-NC-4.0

Eine Creative-Commons-Lizenz, die es erlaubt, das LLM in jeglicher Form zu bearbeiten und zu teilen, jedoch nicht für kommerzielle Zwecke. Der Name des Urhebers muss genannt werden.

CC BY-NC-SA-4.0

Ähnlich wie CC BY-NC-4.0, jedoch mit der zusätzlichen Share-Alike-Bedingung. Das bedeutet, Forks oder bearbeitete Versionen eines LLMs müssen unter den gleichen Bedingungen weitergegeben werden.

nicht-kommerziell

Hier ist die Nutzung des LLMs für kommerzielle Zwecke untersagt. Was genau als „kommerziell“ gilt, ist aber nicht immer eindeutig definiert oder eingegrenzt.

Meistens sind „nicht-kommerzielle“ Modelle nur für Forschungszwecke oder zur privaten Nutzung freigegeben.

4. Open-Source-LLMs lokal auf dem eigenen Rechner nutzen

Open-Source-LLMs lokal auf dem eigenen Rechner zu nutzen, geht einfacher, als du vielleicht denkt:

1. Lade LM Studio herunter

Lade LM Studio von der Website herunter. Es ist kostenlos und für Mac, Windows und Linux verfügbar:

LM Studio

2. Installiere und öffne LM Studio

Im nächsten Schritt installierst du LM Studio auf deinem Rechner und öffnest es.

3. Lade gewünschte Open-Source-LLMs herunter

Jetzt musst du die Open-Source-LLMs in LM Studio herunterladen, die du nutzen möchtest.

Viele beliebte LLMs findest du bereits auf dem Startbildschirm. Um ein LLM herunterzuladen, klickst du einfach auf den blauen Download-Button:

Open-Source-LLMs herunterladen

Um bestimmte Open-Source-LLMs zu finden, kannst du auch die Suchfunktion nutzen:

Open-Source-LLMs suchen

4. Wichtig: Vor dem Download Systemvoraussetzungen beachten

Bevor du ein LLM herunterlädst, solltest du dir die Systemvoraussetzungen anschauen.

Llama 3 benötigt zum Beispiel mehr als 8 GB RAM und 4,92 GB freien Speicherplatz:

Open-Source-LLM Systemvoraussetzungen

5. Mit dem Open-Source-LLM chatten

Nachdem du ein Open-Source-LLM heruntergeladen hast, kannst du es direkt in LM Studio nutzen.

Dazu klickst du einfach links in der Seitenleiste auf das Sprechblasen-Icon (?).

Die Benutzeroberfläche und die Einstellungsmöglichkeiten erinnern dabei an den OpenAI Playground:

Mit Open-Source-LLM chatten

Häufig gestellte Fragen zu Open-Source-LLMs

FH

Finn Hillebrandt

KI-Experte & Blogger

Finn Hillebrandt ist der Gründer von Gradually AI, SEO- und KI-Experte. Er hilft Online-Unternehmern, ihre Prozesse und ihr Marketing mit KI zu vereinfachen und zu automatisieren. Finn teilt sein Wissen hier auf dem Blog in 50+ Fachartikeln sowie über seinen ChatGPT-Kurs und den KI Business Club.

Erfahre mehr über Finn und das Team, folge Finn bei LinkedIn, tritt seiner Facebook-Gruppe zu ChatGPT, OpenAI & KI-Tools bei oder mache es wie 17.500+ andere und abonniere seinen KI-Newsletter mit Tipps, News und Angeboten rund um KI-Tools und Online-Business. Besuche auch seinen anderen Blog, Blogmojo, auf dem es um WordPress, Bloggen und SEO geht.