Microsoft TRELLIS.2: 4B-Modell für Bild-zu-3D-Generierung mit O-Voxel

X-PostSupermanTool

Microsoft hat das Repository für TRELLIS.2 veröffentlicht, ein generatives 3D-Modell mit 4 Milliarden Parametern für die Image-to-3D-Generierung. Es basiert auf einer neuartigen Voxel-Struktur namens O-Voxel und erzeugt PBR-texturierte 3D-Meshes.

Das Wichtigste

  1. 4B-Parameter-Modell basierend auf Diffusion Transformers (DiTs) und einem Sparse-3D-VAE mit 16-fachem räumlichem Downsampling.
  2. Nutzt die feld-freie Datenstruktur O-Voxel zur Unterstützung offener Oberflächen, interner Hohlräume und nicht-mannigfaltiger Geometrien.
  3. Modelliert vollständige PBR-Materialien inklusive Grundfarbe, Rauheit, Metallizität und Opazität.
  4. Erzeugt Assets auf einer NVIDIA H100 in Auflösungen von 512³ (~3 s), 1024³ (~17 s) bis 1536³ (~60 s).
  5. Erfordert ein Linux-System sowie eine NVIDIA-GPU mit mindestens 24 GB VRAM (getestet auf A100 und H100) mit CUDA 12.4.
  6. Nutzer-Feedback aus Praxistests weist auf stark zerteilte Mesh-Topologien hin (z. B. tausende verbundene Komponenten in einzelnen Primitiven).

Warum das relevant ist

Die native 3D-Generierung aus Einzelbildern scheiterte bisher oft an topologischen Beschränkungen von SDF- oder NeRF-basierten Feldern. TRELLIS.2 umgeht diese Einschränkungen und liefert vollständige PBR-Texturen in kurzer Rechenzeit, was Pipelines für Spieleentwicklung und 3D-Modellierung beschleunigen kann.

Einordnung

Das Modell bietet schnelle Inferenzzeiten und eine direkte Konvertierung zwischen Mesh und O-Voxel ohne rechenintensive Optimierungsschleifen. Allerdings deuten frühe Tests von Nutzern darauf hin, dass die erzeugten Meshes für klassische Produktions-Pipelines noch nachbearbeitet werden müssen, da Primitiven sehr hohe Polygonanzahlen und eine extreme Fragmentierung aufweisen können.

Original-Post

Superman

@thesupermanmx · 29. Juli 2026

Repo: t.co/eW7JpjXoED

156 Likes2 Antworten292 Lesezeichen12.339 Aufrufe

Auf X ansehen
Ausgewählte Antworten (1)
  • @FabioAngela79 @thesupermanmx I tested the “production-ready” part on a real TRELLIS.2 GLB. Visually good, but one primitive had 287k faces and 3,684 connected components. A normal split turned it into confetti. So I benchmarked downstream decomposition on my 3090 Ti: t.co/9oA9NwXTlS

Links und Tools aus diesem Beitrag

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Repository:microsoft/TRELLIS.2

    TRELLIS.2: 3D-Generierungsmodell mit O-Voxel-Struktur von Microsoft

    TRELLIS.2 ist ein quelloffenes 3D-KI-Modell mit 4 Milliarden Parametern von Microsoft zur Umwandlung von 2D-Bildern in texturierte 3D-Objekte. Es nutzt eine feldfreie Sparse-Voxel-Darstellung namens O-Voxel und Diffusion Transformers, um komplexe Topologien und PBR-Materialien in hoher Auflösung zu erzeugen.

    11.061SternePython

    KI & AI· Tool

  • Repository:lightningpixel/modly

    Modly: Lokale Desktop-App zur KI-gestützten 3D-Mesh-Generierung

    Modly ist eine Open-Source-Desktop-Anwendung für Windows, Linux und macOS (Apple Silicon), mit der sich 3D-Modelle aus Bildern oder Prompts lokal auf der eigenen GPU berechnen lassen.

    7434SterneTypeScript

    KI & AI· Tool

  • Repository:img2threejs/img2threejs

    img2threejs: Bild-zu-3D-Rekonstruktion als prozeduraler Three.js-Code

    img2threejs rekonstruiert Objekte aus Referenzbildern als prozeduralen, animationsbereiten Three.js-Code. Statt Fotogrammetrie oder Mesh-Extraktion setzt das Projekt auf token-effiziente Code-Generierung.

    15.104SternePython

    KI & AI· Tool

  • X-Post:Amir Mušić

    img2threejs: 2D-Bilder in interaktive 3D-Modelle für Three.js umwandeln

    Amir Mušić stellt die Kombination von Codex und dem Open-Source-Repository img2threejs vor, um aus 2D-Bildern interaktive Three.js-Modelle zu erstellen. Zur Neutexturierung der Modelle schlägt er Werkzeuge wie Nano Banana oder GPT Image v2 vor.

    203Lesezeichen19.441Aufrufe

    KI & AI· Tool

  • Link:Qwen

    Qwen3.8-27B: Multimodales 27B-Modell mit Hybrid-Architektur und Denkmodus

    Das Qwen-Team hat mit Qwen3.8-27B ein kompaktes, dichtes Vision-Language-Modell unter der Apache-2.0-Lizenz veröffentlicht. Das 27-Milliarden-Parameter-Modell kombiniert Gated DeltaNet mit regulärer Attention, versteht Bilder sowie Videos und bietet flexible Steuerungsmöglichkeiten für Denkprozesse.

    KI & AI· Sammlung

  • Artikel:MiniMax Research

    MiniMax stellt multimodales Generierungsmodell H3 vor

    MiniMax hat MiniMax H3 vorgestellt, ein universelles multimodales Generierungsmodell für Text, Bild, Video und Audio. Das Modell erzeugt bis zu 15 Sekunden langes Video in nativer 2K-Auflösung inklusive nativem Stereo-Sound und soll in Kürze quelloffen verfügbar sein.

    KI & AI· Ankündigung

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.