Persona: Desktop-Begleiter für Sprachinteraktionen mit 3D-Avataren

Repositoryxikhar/personaTool

Persona ist eine quelloffene Electron-Applikation, die Sprachkonversationen am Desktop durch animierte 3D-Charaktere visualisiert. Das Tool lauscht auf die Audioausgabe bestimmter Prozesse und synchronisiert die Bewegungen des Avatars in Echtzeit.

Das Wichtigste

  1. Funktionsweise: Lauscht auf die Audioausgabe ausgewählter Prozesse und animiert einen 3D-Charakter (VRM/VRMA) während der Sprachwiedergabe.
  2. Datenschutz: Es zeichnet kein Mikrofon auf, speichert oder transkribiert keine Audiodaten und überträgt keine Daten ins Netzwerk.
  3. Plattformunterstützung: Nutzt betriebssystemeigene Audio-Schnittstellen (Core Audio unter macOS, WASAPI unter Windows, PipeWire unter Linux).
  4. Desktop-Integration: Bietet transparente Overlay-Fenster mit Klick-Durchlässigkeit für Windows und macOS, experimentell auch unter Linux (X11).
  5. Technologie-Stack: Basiert auf TypeScript, Electron, Node.js 24+ und 3D-Grafikbeschleunigung.

Warum das relevant ist

Sprachgestützte KI-Assistenten und Voice-Interfaces gewinnen am Desktop an Bedeutung, bieten aber oft kein visuelles Feedback. Persona löst dieses Problem durch eine lokale, datenschutzfreundliche Visualisierung, ohne Audio ins Netz zu streamen oder selbst Sprachsynthese durchführen zu müssen.

Einordnung

Das Tool richtet sich an Nutzer und Entwickler von Voice-Assistenten, die eine visuelle Präsenz auf dem Desktop wünschen. Durch die Spezialisierung auf das reine Abgreifen der System-Audioausgabe bleibt die Architektur schlank und modular. Das Projekt befindet sich mit rund 900 Sternen in einem aktiven, fortgeschrittenen Entwicklungsstadium, wobei die Linux-Unterstützung (insbesondere bei Wayland und Klick-Durchlässigkeit) noch experimentell ist.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:jamiepine/voicebox

    Voicebox: Open-Source-Studio für lokale Sprachgenerierung und Diktat

    Voicebox ist ein lokales Open-Source-Sprachstudio, das Sprachsynthese, Voice-Cloning und Diktierfunktionen kombiniert. Die Desktop-Anwendung versteht sich als quelloffene Alternative zu proprietären Cloud-Diensten wie ElevenLabs und WisprFlow.

    55.625SterneTypeScript

    KI & AI· Tool

  • Repository:openclaw/openclaw

    OpenClaw: Lokaler KI-Assistent für eigene Geräte und Chat-Kanäle

    OpenClaw ist ein quelloffener KI-Assistent auf TypeScript- und Node.js-Basis, der lokal auf eigenen Geräten läuft und Modelle, Werkzeuge sowie Messenger über ein zentrales Gateway vernetzt.

    388.923SterneTypeScript

    KI & AI· Tool

  • Repository:huggingface/speech-to-speech

    Hugging Face Speech to Speech: Modulare Open-Source-Pipeline für Sprachassistenten

    Hugging Face stellt mit speech-to-speech ein modulares Open-Source-Framework bereit, mit dem sich Sprachassistenten auf Basis von Open-Source-Modellen umsetzen lassen. Die Pipeline deckt VAD, STT, LLM und TTS ab und stellt eine Schnittstelle bereit, die zum OpenAI Realtime Event Set über WebSocket und WebRTC kompatibel ist.

    13.025SternePython

    KI & AI· Tool

  • Repository:milind-soni/OpenMausBot

    OpenMausBot: Open-Source-Alternative zu Grok Bot mit virtueller Maschine

    OpenMausBot ist eine quelloffene Desktop-Anwendung, die mehrere KI-Agenten in einer Chat-Oberfläche vereint. Die Agenten nutzen virtuelle Maschinen und angebundene Anwendungen für die Aufgabenausführung unter lokaler Kontrolle.

    2128SterneTypeScript

    KI & AI· Tool

  • Repository:webprodigies-org/flute

    Flute: Filmische 3D-Szenen aus echten React-Komponenten

    Flute ist ein Open-Source-Renderer von Web Prodigies, der produktive React-UIs in dreidimensionale, filmische Szenen mit Tiefenschärfe, Kamerabewegung und MP4-Export verwandelt. Das Werkzeug ist darauf ausgelegt, dass Coding-Agenten die Regie für Animationen und Kamerafahrten übernehmen.

    139SterneTypeScript

    Webentwicklung· Tool

  • X-Post:MIKE

    Lokale Open-Source-Alternative zu ElevenLabs für Voice Cloning und TTS

    Ein X-Post beschreibt ein quelloffenes Tool eines einzelnen Entwicklers, das Text-to-Speech und Voice Cloning vollständig lokal ausführt. Das Repository erreichte laut Autor 19.400 GitHub-Sterne und positioniert sich als kostenlose Alternative zu kommerziellen Cloud-Diensten wie ElevenLabs.

    21.093Lesezeichen1,1 Mio.Aufrufe

    KI & AI· Tool

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.