Stand der Recherche: 27. September 2026. MiniMax M3.1 ist nicht mehr nur ein Name aus Gerüchten: Im offiziellen MiniMax-Code-Repository existieren inzwischen konkrete MiniMax-M3.1-Konfigurationen und Tests. Gleichzeitig berichten Nutzer am 27. September über eine „M3.1 Flash Preview“ in MiniMax Code. Was noch fehlt, ist mindestens genauso wichtig: MiniMax hat zum Prüfzeitpunkt keine öffentliche M3.1-Modellkarte, keine offizielle Benchmark-Tabelle und keine belastbare M3.1-Preisliste veröffentlicht. [S7][S8][S21][S23]
M3.1 Flash Preview sieht nach einem realen, bereits ausgerollten Preview-Modell aus. Für ein seriöses Qualitätsurteil ist es aber zu früh. Die stärkste belastbare Evidenz betrifft Modell-ID, Kontext-/Output-Testgrenzen und Reasoning-Konfigurationen im MiniMax-Code; frühe Leistungsberichte sind noch anekdotisch. Werte des anonymen Space Bunny Alpha können als Kandidaten-Indiz dienen, dürfen derzeit aber nicht als bestätigte M3.1-Benchmarks bezeichnet werden. [S7][S10][S24][S26]
Was ist bei MiniMax M3.1 bestätigt?
MiniMax-Gründer Yan Junjie sagte bereits am 26. August 2026 in Zusammenhang mit den Halbjahreszahlen, M3.1, M3 Pro und H3.1 seien „nahezu fertig“. In der damaligen Einordnung wurde M3.1 als Modell beschrieben, das Stabilität, Ausgabequalität, Inferenz-Effizienz und Agent-Generalisation verbessern soll. Ein weiterer Bericht vom 27. August beschreibt M3.1 als Fortsetzung des M3-Basismodells mit zusätzlichem Post-Training und besonderem Fokus auf Coding, Tool Use und Agent-Aufgaben. Diese Aussagen stammen aus Berichten über den Earnings Call, nicht aus einer eigenständigen technischen M3.1-Modellkarte. [S15][S16]
Deutlich härter ist die inzwischen sichtbare technische Evidenz im offiziellen MiniMax-Code-Repository. In einem Test wird MiniMax-M3.1 als verwaltetes MiniMax-Modell geführt. Die Testkonfiguration enthält 512.000 Token als Standard-/Katalogkontext, eine 1.000.000-Token-Option und 128.000 Token maximale Ausgabe. Weitere Tests führen Reasoning-Effort-Stufen und speichern M3.1 mit 1M Kontext und aktiviertem oder deaktiviertem Reasoning. Das ist starke Evidenz dafür, dass MiniMax Code M3.1 technisch vorbereitet beziehungsweise bereits integriert hat. Es ist jedoch keine Garantie, dass jede Preview-Route dieselben Limits produktiv anbietet. Test-Fixtures sind keine API-Spezifikation. [S7][S9][S10]
Was bedeutet „Flash Preview“?
Am 27. September taucht die Bezeichnung MiniMax-M3.1-Flash-Preview in Nutzerberichten aus MiniMax Code auf. Ein Thread in der TRAE-Community zeigt die Bezeichnung am selben Tag; dort wird zugleich darauf hingewiesen, dass die reguläre MiniMax-Webseite noch keine brauchbaren Detailinformationen liefert. Ein Linux-DO-Nutzerbericht beschreibt die Preview am selben Tag im laufenden Einsatz. Das ist nützlich als Feldbeobachtung, aber noch kein reproduzierbarer Benchmark. Die offiziellen Code-Artefakte zeigen ihrerseits mehrstufige Reasoning-Konfigurationen für M3.1. [S7][S21][S22]
Die Bezeichnung „Flash“ sollte deshalb vorerst nur als Produkt-/Preview-Label verstanden werden. Ohne technische Dokumentation lässt sich daraus weder eine Parameterzahl noch eine neue Architektur oder ein bestimmtes Preisniveau ableiten.
M3.1 Flash Preview: bekannte und unbekannte Daten
| Merkmal | Stand 27.09.2026 | Evidenz |
|---|---|---|
Modellname MiniMax-M3.1 | bestätigt | offizielles MiniMax-Code-Repository [S7][S8] |
| „M3.1 Flash Preview“ als UI-/Preview-Bezeichnung | beobachtet, noch nicht als öffentliche Modellkarte dokumentiert | Same-Day-Nutzerberichte [S21][S23] |
| Kontext | 512K/1M in offiziellen Code-Tests | [S7][S10] |
| Max. Output | 128K in offiziellen Code-Tests | [S7] |
| Reasoning Effort | mehrstufig in offiziellen Code-Artefakten | [S7][S9] |
| Bild-/Video-Eingabe | für M3 bestätigt; für M3.1 Preview noch nicht öffentlich spezifiziert | M3-Modellkarte [S2] |
| Parameterzahl | unbekannt | keine öffentliche M3.1-Modellkarte gefunden |
| Architektur | unbekannt | keine öffentliche M3.1-Modellkarte gefunden |
| API-Preis | unbekannt | keine M3.1-Preisliste gefunden |
| Open Weights | nicht bestätigt | keine M3.1-Gewichte gefunden |
| Offizielle M3.1-Benchmark-Tabelle | nicht gefunden | Recherche bis 27.09.2026 |
Wichtig: Die 428B/23B-Angabe gehört zu M3, nicht automatisch zu M3.1
MiniMax M3 hat laut offizieller Modellkarte rund 428 Milliarden Gesamtparameter und rund 23 Milliarden aktivierte Parameter, eine 1M-Kontextlänge sowie native Text-, Bild- und Videoeingabe. NVIDIA nennt für M3 ebenfalls 428B Gesamtparameter und etwa 22B aktive Parameter. Solange MiniMax keine M3.1-Modellkarte veröffentlicht, darf diese Architektur nicht einfach auf M3.1 übertragen werden. [S2][S34]
Gibt es schon Benchmarks für M3.1 Flash Preview?
Keine, die ich als bestätigte M3.1-Benchmarks einstufen würde. Das ist die wichtigste Aussage dieses Artikels.
MiniMax selbst hat zum Prüfzeitpunkt keine M3.1-Benchmark-Tabelle veröffentlicht. Independent-Benchmark-Anbieter wie Artificial Analysis führen M3, aber noch keinen verifizierten M3.1-Eintrag. Für M3 liegt der aktuelle Artificial-Analysis-Intelligence-Index bei 29 in der derzeitigen Indexversion; die Seite nennt rund 179 Output-Token/s, 1M Kontext und $0,30/$1,20 pro Million Input-/Output-Token für M3. Diese Werte sind ein M3-Baseline, kein M3.1-Ergebnis. [S30]
Das Beispiel zeigt zugleich, warum Versionsangaben wichtig sind: Artificial Analysis hatte M3 am 8. Juni in einer älteren Indexversion noch mit 55 bewertet. Der Unterschied bedeutet nicht, dass M3 „schlechter geworden“ ist; der Index und das Vergleichsfeld wurden geändert. Benchmarkwerte ohne Versions- und Methodikangabe sind deshalb schnell irreführend. [S31]
Ist Space Bunny Alpha heimlich M3.1?
Das ist derzeit die spannendste, aber auch riskanteste Spur.
OpenRouter listet Space Bunny Alpha seit dem 23. September 2026 als anonymes Stealth-Modell mit 1M Kontext, Text-/Bild-/Videoeingabe, anpassbarem Reasoning und kostenloser Preview. OpenRouter sagt ausdrücklich, dass der Anbieter anonym ist und OpenRouter nicht Entwickler oder Eigentümer des Modells ist. [S24]
Unabhängige Tokenizer-Tests liefern ein starkes Familien-Indiz: YFarmX berichtet, dass die Tokenzählung über zahlreiche Teststrings exakt zur MiniMax-Familie passt. Mehrere unabhängige Identitätsanalysen kommen zum gleichen Grundproblem: Die Tokenizer-Signatur stützt die MiniMax-Familie, trennt aber ältere und neuere M-Generationen nicht zuverlässig. Damit lässt sich „M3.1“ nicht beweisen. [S26][S27][S28]
Dass nun wenige Tage später eine M3.1 Flash Preview in MiniMax Code auftaucht, macht die Hypothese plausibler, aber nicht bewiesen. Bis MiniMax oder der Stealth-Anbieter die Identität bestätigt, sollten Space-Bunny-Ergebnisse immer als Kandidatenwerte gekennzeichnet werden. [S21][S24][S26][S27][S28]
Kandidaten-Benchmarks von Space Bunny Alpha — nicht als M3.1 bestätigt
Die unabhängige Benchmark-Seite spacebunnyalpha.com meldet für Space Bunny Alpha unter anderem:
| Test | Ergebnis | Wichtige Einschränkung |
|---|---|---|
| AI BENCHY, high | 7,0/10 | 12/22 Tests vollständig bestanden; eigener Testmix |
| GPQA Diamond | 82,0 % | nur 60-Fragen-Subset |
| MMLU-Pro | 75 % | unabhängige Ausführung, nicht MiniMax-offiziell |
| Humanity’s Last Exam | 46,1 % | 300-Fragen-Subset; nicht direkt mit Full-Set-Werten gleichsetzen |
Diese Werte sagen etwas über Space Bunny Alpha aus. Sie sagen erst dann etwas Sicheres über MiniMax M3.1, wenn die Identität bestätigt ist. [S25]
Wie stark war M3 als Ausgangspunkt?
M3 ist ein sinnvoller Referenzpunkt, weil MiniMax M3.1 selbst als Weiterentwicklung von M3 positioniert wurde. MiniMax meldete für M3 unter anderem 59,0 % SWE-Bench Pro, 66,0 % Terminal-Bench 2.1, 34,8 % SWE-fficiency, 28,8 % KernelBench Hard und 74,2 % MCP Atlas. Das sind Herstellerwerte mit den von MiniMax dokumentierten Testbedingungen; sie dürfen nicht mit unabhängigen M3.1-Werten verwechselt werden. [S1][S36]
Architektonisch nutzt M3 MiniMax Sparse Attention (MSA). Das zugehörige Paper beschreibt Block-Sparse Attention und berichtet bei einem 109B-Testmodell für 1M-Kontext deutliche Rechen- und Laufzeitvorteile gegenüber Full Attention. M3 ist das öffentlich veröffentlichte Produktionsmodell, das diese MSA-Linie nutzt. [S5]
Frühe Praxiseindrücke: positiv, aber noch schwache Evidenz
Ein Linux-DO-Beitrag berichtet am 27. September von laufendem Einsatz der Preview. Solche Same-Day-Beobachtungen sind für die Hypothesenbildung interessant, haben aber kleine Stichproben, unbekannte Prompts, unbekannte Routingbedingungen und keine Kontrollläufe. Sie gehören deshalb nicht in dieselbe Evidenzklasse wie reproduzierbare Benchmarks. [S22]
Vorläufige Einordnung
M3.1 Flash Preview ist für Entwickler vor allem deshalb interessant, weil drei Dinge gleichzeitig zusammenkommen: MiniMax hat das Modell bereits im August als auf breite Nutzung, Stabilität und Inferenz-Effizienz optimierte M3-Fortsetzung beschrieben; das offizielle MiniMax-Code-Repository enthält inzwischen konkrete M3.1-Konfigurationen; und am 27. September sehen Nutzer die Flash Preview tatsächlich in MiniMax Code. [S7][S15][S21]
Was noch fehlt, ist die Messung. Ohne offizielle Modellkarte, Preisblatt und unabhängige M3.1-Auswertung ist jede Aussage wie „M3.1 schlägt DeepSeek V4.1 Flash“ oder „M3.1 ist Space Bunny“ zu früh. Für einen Coding-Agenten lohnt sich die Preview trotzdem als Testkandidat — idealerweise mit einem eigenen festen Eval-Set aus Bugfixes, Tool-Calls, Repository-Aufgaben und Latenzmessungen.
So würde ich M3.1 Flash Preview jetzt testen
- 10 echte Bugfix-Aufgaben aus bereits gelösten Repositories, jeweils identischer Commit-Stand.
- Tool-Use-Test mit Dateioperationen, Shell, Web/Search und mindestens einem fehlerhaften Tool-Resultat.
- Long-Context-Test bei 128K, 512K und 1M Kontext, sofern die Preview diese Stufen tatsächlich zulässt.
- Reasoning-Effort A/B-Test für
low,highundmax: Erfolgsrate, Output-Token, Zeit bis zur Lösung. - Kosten pro erfolgreicher Aufgabe, sobald MiniMax die M3.1-Preise veröffentlicht — nicht nur Preis pro Million Token.
Damit entsteht ein Benchmark, der für Agent-Workflows mehr Aussagekraft besitzt als eine einzelne akademische Multiple-Choice-Zahl.
Fazit
MiniMax M3.1 Flash Preview ist real genug, um sie ernst zu nehmen, aber noch nicht dokumentiert genug, um sie seriös zu ranken. Das stärkste Beweisstück ist derzeit der offizielle MiniMax-Code mit MiniMax-M3.1, 512K/1M-Kontextoptionen, 128K Output-Testlimit und Reasoning-Konfigurationen. Erste Community-Berichte deuten auf brauchbare Preview-Nutzung hin. Space Bunny Alpha ist ein plausibler M3.1-Kandidat, aber seine Identität ist nicht bestätigt. [S7][S10][S22][S26]
Sobald MiniMax eine Modellkarte, Preise oder offizielle Benchmarkdaten veröffentlicht, sollten diese Angaben die Preview-Indizien ersetzen und der Artikel substanziell aktualisiert werden.
Methodik und Quellenhinweis
Recherche durchgeführt am 27. September 2026. Die Modell-ID, die Kontext- und Output-Grenzen sowie die Reasoning-Konfigurationen wurden gegen das offizielle MiniMax-Code-Repository geprüft. Erste Preview-Beobachtungen stammen aus Community-Quellen und werden ausdrücklich als Feldbeobachtung gekennzeichnet. Kandidatenwerte des anonymen Space Bunny Alpha werden nicht als M3.1-Benchmarks ausgegeben. Herstellerangaben zu M3 sind als solche gekennzeichnet und dienen nur als Baseline. Das vollständige Rechercheprotokoll mit allen geöffneten Quellen liegt dem Quellenpaket bei.
Häufig gestellte Fragen
Was ist die MiniMax M3.1 Flash Preview?
Ein Preview-Build von MiniMax M3.1, der seit dem 27. September 2026 in MiniMax Code zu sehen ist. Das Modell selbst ist im offiziellen MiniMax-Code-Repository belegt; die Flash Preview ist bislang nur durch Nutzerberichte dokumentiert.
Was ist bei MiniMax M3.1 offiziell bestätigt?
Im offiziellen MiniMax-Code-Repository existieren konkrete MiniMax-M3.1-Konfigurationen: 512.000 Token Standardkontext, eine 1.000.000-Token-Option, 128.000 Token maximale Ausgabe und mehrstufige Reasoning-Effort-Konfigurationen. Test-Fixtures sind allerdings keine API-Spezifikation.
Wie groß ist das Kontextfenster von M3.1?
Die Code-Tests von MiniMax führen 512.000 Token als Standard- und Katalogkontext sowie eine Option mit 1.000.000 Token. Ob die Preview-Route diese Stufen produktiv anbietet, ist nicht garantiert.
Gibt es Benchmarks für MiniMax M3.1?
Nein, keine, die man als bestätigte M3.1-Benchmarks einstufen würde. MiniMax hat keine M3.1-Benchmark-Tabelle veröffentlicht, und unabhängige Anbieter führen bislang nur M3, nicht ein verifiziertes M3.1.
Ist Space Bunny Alpha heimlich MiniMax M3.1?
Das ist eine plausible, aber unbewiesene Hypothese. Unabhängige Tokenizer-Tests ordnen Space Bunny Alpha der MiniMax-Familie zu, trennen aber ältere und neuere M-Generationen nicht zuverlässig. Ohne Bestätigung durch MiniMax oder den Anbieter bleiben die Werte Kandidatenwerte.
Was kosten M3.1-Tokens?
Unbekannt. MiniMax hat zum Prüfzeitpunkt keine M3.1-Preisliste veröffentlicht. Die M3-Preise von rund 0,30 US-Dollar pro Million Input- und 1,20 US-Dollar pro Million Output-Token sind eine M3-Baseline und dürfen nicht auf M3.1 übertragen werden.
Kann man MiniMax M3.1 lokal auf dem Mac laufen lassen?
Nein, nicht offiziell. Es wurden keine M3.1-Gewichte veröffentlicht, und die Preview läuft über MiniMax Code. Für lokale M-Modelle bleiben M3 und die bereits veröffentlichten Gewichte die Option.
Lohnt sich ein Test der M3.1 Flash Preview für Coding-Agenten?
Ja, als Testkandidat. Sinnvoll ist ein festes Eval-Set aus echten Bugfix-Aufgaben, Tool-Use-Tests mit Fehlerfällen sowie ein Long-Context-Test – jeweils mit gemessenen Kosten pro erfolgreicher Aufgabe, sobald Preise vorliegen.
Transparenz
Quellen und Prüfgrundlage
Diese Primär- und Referenzquellen bilden die Grundlage der technischen Einordnung. Herstellerangaben und externe Benchmarks werden im Artikel als solche gekennzeichnet.
- minimax.io blog / minimax-m3
- huggingface.co MiniMaxAI / MiniMax-M3
- huggingface.co main / config.json
- huggingface.co main / LICENSE
- arxiv.org abs / 2606.13392
- github.com MiniMax-AI / minimax-code
- github.com catalog / agent-model-selection.test.ts
- github.com catalog / list-models.test.ts
- github.com resolution / model-ref.test.ts
- github.com integration / session-system-queue-repository.integration.test.ts
- minimax.io news / minimax-announces-first-half-2026-financial-results-1787744160
- ir.minimax.io news-events / new-releases
- ir.minimax.io corporate-filings / quarterly-results
- minimax.io news / minimax-m2
- finance.sina.com.cn 2026-08-26 / doc-inipsezp9148443.shtml
- finance.sina.com.cn 2026-08-27 / doc-inipuqhs0676243.shtml
- datalearner.com pretrained-models / minimax-m3-1
- ai.kakarot.net issue-215
- epoch0.tokyo daily / 2026-09-20
- aireiter.com blog / minimax-m3-1-release-api
- forum.trae.cn topic / 182583
- linux.do topic / 2957314
- reddit.com 1wrbvjw / minimax_m31flash_preview
- openrouter.ai stealth / space-bunny-alpha
- spacebunnyalpha.com spacebunnyalpha.com
- yfarmx.com stealth / space-bunny-alpha
- spacebunnyai.com is-space-bunny-alpha-minimax.html
- spacebunnyai.com space-bunny-alpha-vs-minimax-m3.html
- reddit.com 1wpv45g / m31_is_space_bunny_alpha
- artificialanalysis.ai models / minimax-m3
- artificialanalysis.ai articles / minimax-m3
- artificialanalysis.ai comparisons / minimax-m3-vs-gemini-3-flash-reasoning
- artificialanalysis.ai comparisons / minimax-m3-vs-gemini-3-1-flash-lite-preview
- developer.nvidia.com blog / deploy-long-context-reasoning-and-agentic-workflows-with-minimax-m3-on-nvidia-accelerated-infrastructure
- huggingface.co nvidia / MiniMax-M3-NVFP4
- marktechpost.com 01 / minimax-releases-minimax-m3-with-msa-architecture-supporting-1m-token-context-native-multimodality-and-agentic-coding