Multimodalität
Multimodalität bedeutet, dass ein KI-System mit mehr als einer Art von Eingabe oder Ausgabe umgehen kann, etwa Text, Bild und Ton.
Ein multimodales Modell kann Informationen aus unterschiedlichen Formaten gemeinsam verarbeiten. Welche Formate und Kombinationen tatsächlich möglich sind, unterscheidet sich je nach Modell.
Praktische Bedeutung
Das ermöglicht beispielsweise Bildfragen, gesprochene Assistenz und barriereärmere Zugänge zu Informationen.
Gesellschaftliche Bedeutung
Neben neuen Möglichkeiten entstehen Fragen zu Privatsphäre, Erkennbarkeit synthetischer Medien und Fehlern bei der Bildinterpretation.
Ein einfaches Beispiel
Du zeigst einem Assistenten ein Foto und stellst dazu eine gesprochene Frage.
Nicht verwechseln mit
Mehrere Ausgabekanäle allein beweisen kein tiefes Verständnis des gezeigten Inhalts.
Verwandte Begriffe
Quellen und weiterführende Links
Redaktionell verantwortlich: David Schmitt · KI-Unterstützung bei Recherche und Formulierung.
Veröffentlicht: · Aktualisiert: