← Alle WiKI-Begriffe schmittAInander · WiKI

Multimodalität

Multimodalität bedeutet, dass ein KI-System mit mehr als einer Art von Eingabe oder Ausgabe umgehen kann, etwa Text, Bild und Ton.

Ein multimodales Modell kann Informationen aus unterschiedlichen Formaten gemeinsam verarbeiten. Welche Formate und Kombinationen tatsächlich möglich sind, unterscheidet sich je nach Modell.

Praktische Bedeutung

Das ermöglicht beispielsweise Bildfragen, gesprochene Assistenz und barriereärmere Zugänge zu Informationen.

Gesellschaftliche Bedeutung

Neben neuen Möglichkeiten entstehen Fragen zu Privatsphäre, Erkennbarkeit synthetischer Medien und Fehlern bei der Bildinterpretation.

Ein einfaches Beispiel

Du zeigst einem Assistenten ein Foto und stellst dazu eine gesprochene Frage.

Nicht verwechseln mit

Mehrere Ausgabekanäle allein beweisen kein tiefes Verständnis des gezeigten Inhalts.

Verwandte Begriffe

Quellen und weiterführende Links

Redaktionell verantwortlich: David Schmitt · KI-Unterstützung bei Recherche und Formulierung.
Veröffentlicht: · Aktualisiert: