Thinking Machines Lab stellt Interaktionsmodelle für Mensch-KI-Kollaboration vor

ArtikelThinking Machines LabAnkündigung

Thinking Machines Lab präsentiert eine Research Preview sogenannter Interaktionsmodelle. Statt Interaktivität über externe Gerüste (Harnesses) und starre Gesprächszüge zu simulieren, verarbeitet das Modell Audio-, Video- und Textströme nativ in kontinuierlichen 200-ms-Mikro-Turns.

Das Wichtigste

  1. Bisherige Frontier-Modelle arbeiten meist rundenbasiert; ihre Wahrnehmung pausiert während der Antwortgenerierung.
  2. Das neue Interaktionsmodell nutzt kontinuierliche, zeitlich ausgerichtete Mikro-Turns von 200 ms, um Ein- und Ausgaben interleaved zu streamen.
  3. Verzicht auf externe Komponenten wie Voice-Activity-Detection (VAD); das Modell steuert Unterbrechungen, paralleles Sprechen und visuelle Reaktionen nativ.
  4. Zweiteilige Systemarchitektur: Ein latenzarmes Interaktionsmodell hält den Gesprächsfaden in Echtzeit, während ein asynchrones Hintergrundmodell komplexe Denkaufgaben und Tool-Aufrufe ausführt.
  5. Unterstützt gleichzeitige Modaliäten, Echtzeitübersetzung, Time-Awareness und paralleles Browsing oder Generieren von Benutzeroberflächen.

Warum das relevant ist

Viele komplexe Arbeitsabläufe lassen sich vorab nicht vollständig spezifizieren und erfordern laufendes Feedback. Wenn Interaktion nativ im Modell verankert ist, skaliert kollaboratives Verhalten mit der Modellintelligenz, anstatt durch starre Hilfssysteme ausgebremst zu werden.

Einordnung

Thinking Machines Lab adressiert den Flaschenhals autonomer Agenten-Workflows, die Nutzer aus dem Prozess drängen. Technisch wird die Latenz durch das Aufteilen von Streams in 200-ms-Blöcke gelöst, kombiniert mit einer Aufgabenteilung zwischen Interaktions- und Hintergrundmodell. Damit entfällt das Problem starrer Schnittstellen, wodurch sich Reaktionen auf visuelle Hinweise oder proaktive Einwürfe direkt im Modell abbilden lassen.

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Artikel:Thinking Machines Lab

    Thinking Machines Lab stellt Open-Weights-Modell Inkling vor

    Thinking Machines Lab hat Inkling veröffentlicht, ein multimodales Mixture-of-Experts-Modell mit 975 Milliarden Gesamtparametern (41 Milliarden aktiv) und 1 Million Token Kontext. Es ist vor allem als vielseitige Open-Weights-Basis für Fine-Tuning über die eigene Plattform Tinker gedacht.

    KI & AI· Ankündigung

  • Artikel:Thinking Machines Lab

    Thinking Machines Lab veröffentlicht Inkling-Small

    Thinking Machines Lab hat Inkling-Small vorgestellt, ein multimodales Open-Weights-Modell mit Mixture-of-Experts-Architektur (276 Mrd. Gesamtparameter, 12 Mrd. aktiv), das trotz geringerer Größe bei vielen Aufgaben mit dem größeren Inkling konkurriert.

    KI & AI· Ankündigung

  • Artikel:Brian Johnson und Eloi Du Bois

    Sparrow-2: Ganzheitliches Szenenverständnis für Konversations-KI

    Tavus stellt mit Sparrow-2 ein audiogebundenes Sprachmodell vor, das das Turn-Taking grundlegend überarbeitet. Statt Audiosignale durch Rauschunterdrückung künstlich zu bereinigen und das Gesprächsende über Pausen zu ermitteln, analysiert das Modell die gesamte akustische Szene samt Nebengeräuschen, Sprecheridentität und Prosodie.

    KI & AI· Forschung

  • Artikel:Jiaqi Liu et al.

    AutoResearchClaw: Multi-Agenten-Forschung mit iterativer Selbstkorrektur und Human-in-the-Loop

    Ein Forschungsteam um Jiaqi Liu stellt AutoResearchClaw vor, eine autonome Forschungspipeline auf Basis kooperierender Agenten. Das System bricht mit linearen Ausführungsmodellen und setzt auf iterative Fehlerkorrektur, überprüfbare Resultate sowie anpassbare menschliche Eingriffe. Im Benchmark ARC-Bench schlägt es vergleichbare Ansätze wie AI Scientist v2 deutlich.

    KI & AI· Forschung

  • Link:Tavus

    Tavus: Plattform für interaktive Video-KI-Agenten („PALs“)

    Tavus stellt mit „PALs“ interaktive Video-KI-Agenten vor, die in Echtzeit sehen, hören und emotional reagieren können. Die Plattform kombiniert Basiskodelle für Rendering, multimodale Wahrnehmung und Dialogführung mit Entwickler-APIs und No-Code-Tools.

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.