OpenAI Jalapeño: Eigener Inferenz-ASIC schlägt Nvidia Blackwell bei Energieeffizienz

ArtikelBryan Shan, Myron Xie, Jordan NanosNews

OpenAI hat auf der Hot-Chips-Konferenz Details zu seinem ersten hauseigenen KI-Chip namens Jalapeño vorgestellt. Der in Kooperation mit Broadcom entwickelte Inferenz-ASIC übertrifft laut Tests von SemiAnalysis etablierte GPUs wie Nvidias Blackwell und selbst Nvidias Vera Rubin bei Durchsatz pro Megawatt.

Das Wichtigste

  1. In nur rund 16 Monaten von der Teamgründung bis zum Tape-out entwickelte OpenAI gemeinsam mit Broadcom den spezialisierten Inferenz-Chip Jalapeño.
  2. Entgegen Spekulationen ist der Chip nicht exklusiv auf OpenAI-Modelle beschränkt, sondern ein allgemeiner Inferenz-ASIC, der auch Open-Source-Modelle wie DeepSeek R1, Kimi-K2.5 und GPT-OSS ausführt.
  3. Jalapeño nutzt HBM4 und TSMC N3P; die A0-Version schlägt Nvidias Blackwell bei Durchsatz pro Megawatt (perf/W) und Interaktivität selbst mit Single-Token-Prediction (ohne MTP oder Speculative Decoding).
  4. Gegenüber Nvidias neuer Rubin-Architektur liegt Jalapeño beim Energieverbrauch pro Token vorne und auf Augenhöhe bei den Total Cost of Ownership (TCO).
  5. Einschränkungen: Bisher wurden primär synthetische 8k1k-Inferenztests (InferenceX) gefahren; Langzeit- und agentische Benchmarks (AgentX) stehen noch aus, und Jalapeño existiert bisher nur als Engineering Sample.

Warum das relevant ist

Die Verfügbarkeit von Rechenzentrums-Strom (Megawatt) ist heute der größte Flaschenhals für KI-Betreiber. Ein Chip mit drastisch höherer Energieeffizienz pro Token senkt nicht nur Betriebskosten, sondern verringert auch die Marktabhängigkeit von Nvidias Margen und Lieferketten.

Einordnung

OpenAIs Einstieg in eigenes Silizium markiert einen Wendepunkt für Hyperscaler und KI-Labore. Die pragmatische Ausrichtung auf homogene Inferenz-Pools ohne getrennte Prefill-/Decode-Hardware vereinfacht den Betrieb, während HBM4 und TSMCs N3P-Node für enorme Bandbreite sorgen. Noch handelt es sich um Testmuster (A0 getestet, B0 in der Fab), und Tests auf komplexeren agentischen Workflows (AgentX) müssen die Leistung unter realistischen Cache-Bedingungen erst noch bestätigen.

Gefunden in

Zusammenfassung von KI erstellt (Gemini 3.8 Flash, 27. September 2026). Sie kann Fehler enthalten – maßgeblich ist die Originalquelle.

Inhaltlich ähnlich, ermittelt über die KI-Suche.

  • Link:Etched

    Etched stellt Frontier-Inference-Cluster vor und sichert sich 800 Millionen Dollar

    Das KI-Hardware-Startup Etched entwickelt spezialisierte Inferenz-Cluster für Frontier-Modelle. Nach der Fertigung erster A0-Silizium-Chips bei TSMC N4P meldet das Unternehmen 800 Millionen US-Dollar an eingeworbenem Kapital und Kundenverträge im Umfang von einer Milliarde US-Dollar.

    KI & AI· Ankündigung

  • Link:NVIDIA

    NVIDIA DGX Spark: Desktop-KI-Supercomputer mit Grace-Blackwell-Chip

    NVIDIA stellt mit dem DGX Spark einen kompakten Desktop-Supercomputer vor, der speziell auf lokale autonome Agenten und generative KI-Workloads ausgelegt ist. Das System basiert auf dem GB10 Grace Blackwell Superchip und bietet 128 GB kohärenten Unified Memory.

    KI & AI· Tool

  • Artikel:Julie Bort

    Hardware-Startup Etched verdoppelt Bewertung auf 21 Milliarden Dollar

    Das KI-Hardware-Startup Etched hat 700 Millionen US-Dollar bei einer Bewertung von 21 Milliarden Dollar aufgenommen. Angeführt wurde die Runde von Jane Street, nachdem das Trading-Unternehmen die Inferenz-Hardware von Etched getestet und erworben hat.

    KI & AI· News

  • Artikel:Nate B. Jones

    AI News & Strategy Daily: Nate B. Jones über Agent-Ökonomie, Hardware und Modell-Strategien

    Im Podcast AI News & Strategy Daily analysiert Stratege Nate B. Jones aktuelle Entwicklungen im KI-Bereich. Im Fokus der Episoden von August und September 2026 stehen Effort-Level bei Claude Fable 5.1, die Lock-in-Gefahr durch proprietäre Chips wie OpenAIs Jalapeño, Apples M6-Strategie für lokale Modelle sowie das Management von KI-Agenten und deren reale Betriebskosten.

    KI & AI· Meinung

  • Link:Modular

    Modular: Einheitlicher KI-Inferenz-Stack von GPU-Kernels bis zur Cloud

    Modular stellt seine Inferenzplattform vor, die KI-Workloads herstellerunabhängig über unterschiedliche Architekturen wie NVIDIA, AMD, TPU, Trainium und Apple Silicon ausführt. Der Stack umfasst das Serving-Framework MAX und die Programmiersprache Mojo.

    KI & AI· Tool

  • Video

    Video:Supermicro

    Supermicro und SemiAnalysis über KI-Hardware im Hyperscale-Maßstab auf der Computex 2026

    Im Gespräch auf der Computex 2026 diskutieren Dylan Patel (SemiAnalysis) und Vik Malyala (CBO von Supermicro) über die nächste Generation von KI-Serverarchitekturen. Im Mittelpunkt stehen neue Plattformen wie AMD HELIOS und NVIDIA Vera Rubin, PCIe-Gen-6-Speicherlösungen sowie die Notwendigkeit von Flüssigkühlung für Racks und Speicherkomponenten.

    KI & AI· Diskussion

Lassen Sie uns über Ihr Projekt sprechen

Standorte

  • Mattersburg
    Johann Nepomuk Bergerstraße 7/2/14
    7210 Mattersburg, Austria
  • Wien
    Ungargasse 64-66/3/404
    1030 Wien, Austria

Dieser Inhalt wurde teilweise mithilfe von KI erstellt.