Welche KI versteht die Welt wirklich?
Ein multimodales LLM kann ein Foto analysieren, ein Video zusammenfassen und dir erklären, was auf einem Screenshot zu sehen ist. Beeindruckend? AAbsolut. Aber versteht das Modell deshalb schon, was in der Welt passiert?
Genau an diesem Punkt wird es spannend. Denn während multimodale Sprachmodelle immer mehr Sinne bekommen, arbeitet eine andere KI-Forschungsrichtung an einer grundlegend anderen Frage: Wie kann eine Maschine die Welt intern abbilden, Veränderungen vorhersagen und die Folgen eigener Handlungen einschätzen?
Hier kommen JEPA-Modelle ins Spiel. Yann LeCuns Forschungsansatz soll nicht primär Texte erzeugen oder Bilder beschreiben. JEPA steht für Joint Embedding Predictive Architecture und verfolgt das Ziel, abstrakte Repräsentationen von Zuständen vorherzusagen. Das klingt zunächst weniger spektakulär als ein Chatbot, könnte für Robotik, autonome Systeme und KI-Agenten aber deutlich wichtiger sein.
Für uns ist deshalb klar: JEPA und multimodale LLMs sind keine einfachen Konkurrenten. Sie lösen unterschiedliche Probleme und könnten in zukünftigen KI-Systemen gemeinsam eingesetzt werden.
Was ist JEPA?
JEPA ist eine Modellarchitektur, die nicht jedes Detail einer Eingabe rekonstruieren möchte. Stattdessen lernt sie, relevante Eigenschaften einer Situation in einem abstrakten Merkmalsraum vorherzusagen.
Bei I-JEPA, dem bildbasierten Ansatz von Meta, wird beispielsweise ein Teil eines Bildes verdeckt. Das Modell soll diesen Bereich nicht Pixel für Pixel nachzeichnen. Es soll vielmehr die abstrakte Repräsentation des fehlenden Bereichs vorhersagen. Dadurch lernt es, welche Objekte, Formen und Strukturen wahrscheinlich vorhanden sind.
Bei V-JEPA wird dieses Prinzip auf Videos übertragen. Das Modell sieht Teile einer zeitlichen Entwicklung und prognostiziert, wie die Szene auf einer abstrakten Ebene weitergeht. Es muss also nicht jedes einzelne Pixel des nächsten Frames erzeugen, sondern relevante Informationen über Bewegung, Objektzustände und Interaktionen lernen.
Das ist ein wichtiger Unterschied zu vielen generativen Modellen. Ein Video kann auf Pixelebene extrem komplex und unvorhersehbar sein. Die Bewegung einzelner Blätter im Wind lässt sich kaum exakt berechnen. Trotzdem kann ein Modell lernen, dass der Baum an seiner Position bleibt, ein Hindernis darstellt und sich die Kamera auf ihn zubewegt.
JEPA in einem Satz
JEPA versucht nicht primär, die Welt möglichst realistisch auszugeben, sondern ihre relevanten Zustände und Veränderungen intern vorherzusagen.
Damit gehört JEPA in die Nähe von Weltmodellen. Ein solches Modell soll beispielsweise einschätzen können, was passiert, wenn ein Roboter nach einer Tasse greift, eine Tür öffnet oder einen Gegenstand verschiebt.
Was sind multimodale LLMs?
Multimodale Large Language Models erweitern klassische Sprachmodelle um zusätzliche Modalitäten. Neben Text können sie je nach Modell Bilder, Audio, Video oder Dokumente verarbeiten.
Typischerweise besteht ein multimodales LLM aus mehreren Komponenten:
- einem Sprachmodell als zentraler Verarbeitungseinheit,
- einem Bild-, Audio- oder Video-Encoder,
- einem Adapter oder Projektor, der die Informationen mit dem Sprachmodell verbindet,
- und gegebenenfalls zusätzlichen Modulen für Spracheingabe, Bildausgabe oder Tool-Nutzung.
Ein multimodales LLM kann beispielsweise ein Foto eines Formulars analysieren und beantworten, welche Pflichtfelder noch nicht ausgefüllt sind. Es kann einen Screenshot erklären, ein Diagramm interpretieren, ein Video zusammenfassen oder aus einem gesprochenen Meeting eine Aufgabenliste erstellen.
Die Kernfrage lautet dabei häufig:
Welche Antwort passt zu den verfügbaren multimodalen Informationen?
Das Ergebnis ist meist Text, strukturierte Daten, ein Tool-Aufruf oder eine andere generierte Ausgabe. Multimodale LLMs sind daher besonders stark bei Kommunikation, Wissensarbeit und der Verbindung verschiedener Eingabeformate
Die wichtigsten Unterschiede
| Kriterium | JEPA | Multimodales LLM |
|---|---|---|
| Hauptziel | Zustände und Veränderungen vorhersagen | Multimodale Informationen verstehen und Ausgaben erzeugen |
| Typische Eingaben | Bilder, Videos, Sensor- und Bewegungsdaten | Text, Bilder, Audio, Video und Dokumente |
| Typische Ausgabe | Abstrakte Embeddings oder Zustandsrepräsentationen | Text, Code, strukturierte Daten oder Tool-Aufrufe |
| Lernziel | Vorhersage relevanter Merkmale | Vorhersage passender Tokens oder Ausgaben |
| Zeitverständnis | Von Beginn an auf Dynamik und Veränderung ausgerichtet | Muss zeitliche Zusammenhänge zusätzlich lernen |
| Sprachfähigkeit | Nicht der Schwerpunkt | Zentrale Stärke |
| Physikalische Modellierung | Potenziell stark | Nicht automatisch zuverlässig |
| Robotik | Wahrnehmung, Vorhersage und Planung | Sprache, Aufgabenverständnis und Koordination |
| Rechenaufwand | Kann effizient sein, da keine Pixelrekonstruktion nötig ist | Häufig hoch, insbesondere bei langen Bildern und Videos |
| Typische Schwäche | Noch begrenzte Sprach- und Allgemeinfähigkeiten | Plausible Antworten ohne robustes Welt- oder Physikverständnis |
Unterschiedliche Lernziele, unterschiedliche Fähigkeiten
Der technische Kernunterschied liegt im Trainingssignal.
Ein multimodales LLM lernt vereinfacht gesagt:
„Welche Textsequenz oder Handlung passt zu diesem Bild, Video oder Gespräch?“
Ein JEPA-Modell lernt eher:
„Welche abstrakte Repräsentation wird dieser Teil der Szene wahrscheinlich annehmen?“
Diese beiden Fragen führen zu unterschiedlichen Fähigkeiten.
Ein multimodales LLM kann ein Bild mit hoher sprachlicher Qualität beschreiben. Es kann erklären, dass auf einem Tisch eine Tasse neben einem Laptop steht. Es kann sogar eine Handlung vorschlagen: „Greife die Tasse am Henkel.“
Ein JEPA-Modell soll dagegen die Entwicklung des Zustands modellieren. Was passiert, wenn die Tasse am Henkel angehoben wird? Wie verändert sich ihre Position? Kippt sie? Wird sie von einem Objekt verdeckt? Welche Bewegung ist aufgrund der räumlichen Situation überhaupt möglich?
Das ist der Unterschied zwischen über eine Situation sprechen und ihre Dynamik modellieren.
Ein Beispiel aus der Robotik
Stellen wir uns einen Roboter vor, der eine blaue Flasche vom Tisch nehmen soll.
Ein multimodales LLM kann:
- die Anweisung „Nimm die blaue Flasche“ verstehen,
- mehrere Flaschen anhand ihrer Farbe unterscheiden,
- die Szene sprachlich beschreiben,
- einen groben Handlungsplan erstellen,
- bei Rückfragen mit einem Menschen kommunizieren.
Das Modell ist damit der sprachliche und semantische Teil des Systems.
Ein JEPA-basiertes Weltmodell kann ergänzend:
- die Position der Flasche im Raum repräsentieren,
- verdeckte Teile der Szene einschätzen,
- die Bewegung der Flasche prognostizieren,
- mögliche Greifbewegungen vergleichen,
- die Folgen einer Armbewegung vorhersagen,
- und Veränderungen der Szene über mehrere Zeitschritte modellieren.
Für die tatsächliche Bewegung braucht es zusätzlich einen Controller und Sensoren. JEPA ist also kein fertiger Roboter, sondern ein möglicher Baustein für dessen interne Wahrnehmung und Planung.
Die wahrscheinlich sinnvollste Architektur verbindet daher beide Ansätze:
- Das multimodale LLM interpretiert die menschliche Anweisung.
- Ein visueller Encoder erkennt die Objekte und die Szene.
- Das JEPA-Weltmodell prognostiziert mögliche Zustände.
- Ein Planer wählt eine Handlung.
- Ein Controller führt die Bewegung aus.
- Sensoren prüfen, ob die erwartete Veränderung eingetreten ist.
- Das Sprachmodell kommuniziert Ergebnis oder Unsicherheit.
Warum JEPA effizienter sein kann
Ein klassisches generatives Videomodell muss möglicherweise jedes Detail des nächsten Bildes vorhersagen. Das ist rechenintensiv und nicht immer sinnvoll. Viele Bilddetails sind für eine Handlung irrelevant oder ohnehin nicht zuverlässig vorhersehbar.
JEPA verfolgt einen anderen Weg: Das Modell arbeitet in einem abstrakten Merkmalsraum. Es muss nicht jedes Pixel erzeugen, sondern soll die wesentlichen Eigenschaften einer Szene erfassen.
Meta beschreibt V-JEPA daher als nichtgeneratives Modell, das relevante semantische Informationen lernen kann, ohne die Szene vollständig zu rekonstruieren. Dadurch soll der Ansatz bei bestimmten Aufgaben effizienter mit Trainingsdaten und Rechenleistung umgehen.
Auch V-JEPA 2 geht über reine visuelle Repräsentation hinaus. Meta positioniert das Modell als visuelles Weltmodell, das mit Roboterdaten angepasst wurde und Aufgaben wie Greifen, Erreichen und „Pick-and-place“ in neuen Umgebungen unterstützen soll.
Allerdings sollten solche Herstellerangaben mit der nötigen Distanz betrachtet werden. Gute Ergebnisse in begrenzten Robotik- oder Videodatensätzen bedeuten noch nicht, dass ein Modell in einer offenen, chaotischen Alltagswelt zuverlässig planen kann.
Die Grenzen multimodaler LLMs
Multimodale LLMs sind heute ausgesprochen vielseitig. Sie analysieren Bilder, transkribieren Audio, beantworten Fragen zu Videos und verarbeiten Dokumente. Trotzdem ergeben sich einige typische Grenzen.
Plausibilität ist nicht automatisch Verständnis
Ein Modell kann eine überzeugende Erklärung formulieren, ohne die Situation robust zu repräsentieren. Es weiß möglicherweise, wie Menschen über eine Szene sprechen, besitzt aber kein stabiles internes Modell ihrer physikalischen Dynamik.
Schwierige räumliche Beziehungen
Feine räumliche Details, Entfernungen, verdeckte Objekte oder komplexe Bewegungsabläufe können problematisch sein. Besonders dann, wenn die Aufgabe nicht nur eine Beschreibung, sondern eine zuverlässige Handlung erfordert.
Langfristige Konsistenz
Ein multimodales LLM kann zu verschiedenen Zeitpunkten eines Videos widersprüchliche Annahmen machen. Ein echtes Weltmodell müsste Objektidentitäten, Zustände und Ursache-Wirkungs-Beziehungen über längere Zeit stabil halten.
Token- und Rechenaufwand
Bilder und Videos werden häufig in viele visuelle Tokens umgewandelt. Je länger das Video und je höher die Auflösung, desto mehr Speicher und Rechenleistung werden benötigt. Bei multimodalen Agenten mit langen Sitzungen kann dieser Aufwand schnell wachsen.
Die Forschung diskutiert deshalb, ob aktuelle multimodale LLMs tatsächlich ein tiefes, kausales Weltverständnis besitzen oder ob sie vor allem sehr leistungsfähig darin sind, statistische Beziehungen zwischen Bild, Sprache und Kontext zu nutzen.
Sind JEPA und multimodale LLMs Gegensätze?
Nein. Der Gegensatz „JEPA gegen multimodale LLMs“ ist für die Praxis vermutlich zu stark vereinfacht.
Multimodale LLMs sind besonders nützlich für:
- natürliche Sprache,
- Dialog und Assistenz,
- Wissenszugriff,
- Dokumentenverarbeitung,
- Bild- und Videoanalyse,
- Programmierung,
- Web- und Tool-Agenten.
JEPA-ähnliche Modelle sind besonders interessant für:
- visuelle Repräsentation,
- Videoverständnis,
- Bewegungsvorhersage,
- Zustandsmodellierung,
- Robotik,
- autonome Systeme,
- physische Interaktion,
- simulationsbasierte Planung.
Für moderne KI-Agenten könnte daraus eine arbeitsteilige Architektur entstehen. Das LLM übernimmt Ziele, Sprache, Wissen und Werkzeuge. Das Weltmodell bewertet, wie sich eine Umgebung durch eine Handlung verändern könnte.
Auch für Software-Agenten ist diese Unterscheidung interessant. Ein LLM kann beschreiben, wie eine WordPress-Änderung durchgeführt wird. Ein systemisches Weltmodell müsste zusätzlich abbilden, welche Folgen die Änderung für Tracking, Formulare, Performance, SEO oder Conversion haben könnte. In diesem Sinne kann der Begriff Weltmodell auch außerhalb der Robotik relevant werden: als interne Zustands- und Abhängigkeitsbeschreibung einer digitalen Umgebung.
Unser Fazit
JEPA und multimodale LLMs stehen für zwei unterschiedliche Entwicklungsrichtungen der künstlichen Intelligenz.
Multimodale LLMs machen KI vielseitiger. Sie können sehen, hören, lesen, sprechen und aus unterschiedlichen Informationsquellen Antworten erzeugen. Für Business-Anwendungen, Content, Support, Recherche und Agenten bleiben sie deshalb unverzichtbar.
JEPA verfolgt dagegen eine weniger offensichtliche, aber möglicherweise fundamentalere Idee: Eine intelligente Maschine sollte nicht nur wissen, wie sie über die Welt spricht. Sie sollte modellieren können, wie sich die Welt verändert.
Für uns ist deshalb die Hybridstrategie am überzeugendsten. Das multimodale LLM ist der kommunikative und wissensbasierte Teil. JEPA oder ein vergleichbares Weltmodell liefert die Zustands- und Dynamikrepräsentation. Erst die Kombination aus Sprache, Wahrnehmung, Vorhersage, Gedächtnis und Handlung bringt KI näher an wirklich autonome Systeme.
Der große Hype um Chatbots hat uns gezeigt, wie leistungsfähig Sprachmodelle sind. JEPA erinnert uns nun daran, dass Intelligenz mehr ist als Textgenerierung. Die entscheidende Frage der nächsten Jahre wird deshalb nicht lauten, welches Modell die längste Antwort schreiben kann.
Sie lautet:
Welches KI-System kann eine Situation verstehen, ihre Entwicklung vorhersagen und zuverlässig handeln?
Multimodale LLMs werden uns weiterhin erklären, was passiert. Weltmodelle wie JEPA könnten künftig dabei helfen, vorherzusagen, was als Nächstes passiert und welche Handlung tatsächlich sinnvoll ist.
Hinweis: Dieser Artikel enthält Inhalte, die mit Unterstützung eines KI-Systems erstellt wurden. Die Inhalte wurden anschließend von einem Menschen mit ❤️ überprüft und bearbeitet, um Qualität und Richtigkeit sicherzustellen.
