Что такое мультимодальные нейросети?

Мультимодальные нейросети работают не только с текстом, но и с изображениями, звуком, видео и файлами: могут описать фото, распознать документ, расшифровать речь, ответить голосом или сгенерировать картинку. Большинство современных ассистентов мультимодальны — поэтому им можно отправить скриншот, голосовое или PDF.

Обновлено

Подробно

Какие бывают модальности

Заметки

Где это полезно в заметках

Минусы

Ограничения

Модель может неверно понять изображение: перепутать мелкий текст, числа на графике, людей на фото. С видео многие ассистенты работают ограниченно или анализируют только часть кадров. Для точных данных — сверка с оригиналом.

Пример

Пример

Скриншот графика продаж и голосовой вопрос «что здесь не так?». Модель читает оси и значения и замечает провал в августе. Но цифру на оси она может прочитать неточно — её стоит проверить по исходным данным.

Ошибки

Частые ошибки

Вопросы

Частые вопросы по теме

ChatGPT мультимодальный?

Да, современные версии работают с текстом, изображениями, голосом и файлами.

Понимает ли ИИ видео?

Частично: зависит от сервиса; часто удобнее дать расшифровку.

Может ли ИИ отвечать голосом?

Многие ассистенты поддерживают голосовой режим.

Дороже ли мультимодальные запросы?

Обычно изображения и аудио расходуют больше токенов, чем короткий текст.

Нужна ли мультимодальность для заметок?

Полезна: голос и фото — самые быстрые способы записи.

Может ли ИИ по фото понять, что за растение или блюдо?

Часто да, но для еды, лекарств и растений, от которых зависит здоровье, опирайтесь на специалистов и справочники.