Zdolność modelu AI do pracy z różnymi typami danych, np. tekstem, obrazem, dźwiękiem i wideo.
Najprościej mówiąc
Model multimodalny może analizować więcej niż sam tekst: zdjęcie, wykres, dokument, nagranie albo obraz z kamery.
Przykład użycia
Użytkownik wrzuca zdjęcie rachunku, a model odczytuje kwoty, wyjaśnia pozycje i tworzy podsumowanie.
Najczęstsze nieporozumienie
Model multimodalny nadal może się mylić. Widzenie obrazu nie oznacza pełnego zrozumienia sytuacji.
Dlaczego to ważne?
Multimodalność przesuwa AI z czatu tekstowego w stronę narzędzia do pracy z całym środowiskiem informacyjnym.