MiniMax stellt multimodales Generierungsmodell H3 vor

ArtikelMiniMax ResearchAnkündigung

MiniMax hat MiniMax H3 vorgestellt, ein universelles multimodales Generierungsmodell für Text, Bild, Video und Audio. Das Modell erzeugt bis zu 15 Sekunden langes Video in nativer 2K-Auflösung inklusive nativem Stereo-Sound und soll in Kürze quelloffen verfügbar sein.

Das Wichtigste

  1. Verarbeitet Text, Bild, Video und Audio in einem gemeinsamen Kontext und generiert bis zu 15 Sekunden Video in 2K mit integriertem Stereo-Ton.
  2. Löst getrennte Sub-Modelle (T2I, I2V, T2V, Audio-Tools) auf und vereinheitlicht Referenz- und Editierungsaufgaben über natürliche Sprache.
  3. Setzt auf neue Architekturkomponenten: H3-VAE (4-fache Sequenzlängeneffizienz), H3-Omni Transformer und In-Context Regeneration statt klassischer Upscaling-Module.
  4. MiniMax gibt an, dass der Preis pro Sekunde bei 2K weniger als ein Drittel und bei 768p weniger als die Hälfte vergleichbarer Mainstream-Modelle beträgt.
  5. Die Modellgewichte sollen in den kommenden Tagen unter Berücksichtigung rechtlicher Vorgaben veröffentlicht werden.

Warum das relevant ist

Während die Video- und Audiogenerierung lange von proprietären, geschlossenen Modellen dominiert wurde, verspricht MiniMax mit der Veröffentlichung der Gewichte von H3 einen bedeutenden Open-Source-Schritt. Durch die native Verknüpfung von Audio und Video sowie die Steuerung komplexer Referenzen über Sprache wird die Erstellung kommerzieller Werbe-, Produkt- und UI-Inhalte deutlich flexibler und kostengünstiger.

Einordnung

MiniMax bricht mit der bisherigen Praxis, spezialisierte Teilmodelle für Bild-, Video-, Audio- und Schnittaufgaben zu verketten. Stattdessen wird Sprache als Bindeglied genutzt, um komplexe Vorgaben – wie die Kombination einer Kamerabewegung aus Video A mit einem Gesicht aus Bild B und Ton aus Audio C – direkt in einem System zu verarbeiten. Technisch bemerkenswert ist die 'In-Context Regeneration' für 2K-Auflösungen, bei der das Basismodell Details anhand des Kontexts neu berechnet, statt bloß statistisch hochzuskalieren.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:MiniMax

    MiniMax Modellübersicht: Sprach-, Video-, Audio- und Musik-APIs

    Die API-Dokumentation von MiniMax listet die verfügbaren und älteren KI-Modelle für Sprache, Videogenerierung, Sprachsynthese und Musik auf. Zu den aktuellen Spitzenmodellen gehören MiniMax-M3 mit einem Kontextfenster von 1 Million Tokens sowie die Videomodelle MiniMax H3 und H3 Max.

    KI & AI· Sammlung

  • Repository:MiniMax-AI/MiniMax-H3

    MiniMax-H3: Agent-Skills für Videogenerierungs-Prompts

    MiniMax-H3 stellt ein Repository mit neun Agent-Skills bereit, darunter ein spezialisierter Prompt-Writing-Skill für die H3-Videomodelle von MiniMax und Hailuo AI.

    8076SternePython

    KI & AI· Sammlung

  • X-Post:Stable Diffusion Tutorials

    Minimax H3 NSFW: Unzensierte Modellvariante auf Hugging Face geteilt

    Stable Diffusion Tutorials teilt einen Link zu einem Hugging-Face-Repository namens MINIMAX-H3-NSFW von Blackfrost-Research. Das Modell wird als unzensierte Variante beschrieben, die für Creator, Indie-Studios und Bildungszwecke gedacht ist.

    10.823Lesezeichen2,1 Mio.Aufrufe

    KI & AI· Sammlung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.