• 7 октября, 2024

GigaChat научился распознавать изображения

Нейросетевая модель GigaChat Pro обрела новую модальность. Теперь в качестве запроса пользователь может отправить иллюстрацию, чтобы сервис использовал её как дополнительный контекст. Модель определит, сколько людей на фото, во что они одеты, даст совет по стилю одежды и многое другое.

Также модель научилась распознавать печатный и рукописный текст, формулы, графики, таблицы и анализировать данные, которые в них содержатся. Например, студенты могут сфотографировать часть учебного материала или конспекта, загрузить изображение и в несколько кликов получить короткое содержание текста, его ключевую тему и сформировать план дальнейшей работы с ним.

Функциональность доступна и бизнес-клиентам через API. Компании могут использовать искусственный интеллект в ещё большем числе сценариев: модерировать и классифицировать отзывы, систематизировать медиаконтент, автоматизировать линию поддержки (когда клиент прикладывает к обращению скрин или фото). Ретейлеры могут загружать изображение товара и просить сервис придумать к нему продающее описание.

Также в четыре раза был увеличен размер контекста как GigaChat Pro, так и версии GigaChat Lite — с 8 тыс. до 32 тыс. токенов. Если раньше в один запрос можно было загрузить объём текста, сопоставимый с 15 страницами A4 (шрифт 14 pt), то теперь максимальный объём запроса вырос до 60 страниц. Кроме того, у моделей повысился уровень математических знаний, а GigaChat Pro научился лучше форматировать текст — расставлять параграфы, заголовки, используя выделения и списки.

Андрей Белевцев, старший вице-президент, руководитель блока «Технологическое развитие» Сбербанка:

«Мультимодальность расширяет способы и сферы применения больших языковых моделей, она же — ключевой тренд развития генеративного искусственного интеллекта. Теперь GigaChat умеет распознавать изображения — и это не просто ещё один важный шаг в развитии нашего сервиса, он открывает широкий спектр новых возможностей для наших пользователей. В том числе появляется много сценариев использования GigaChat API для бизнеса. Кроме того, увеличение размера контекста системы в четыре раза позволит поддерживать более длинные диалоги с пользователями и проще реализовывать кейсы с механикой RAG».

Похожие статьи

«Самый важный мягкий навык сегодня — умение себя мотивировать»: Герман Греф провел открытый диалог со студентами программы AI360 и Бизнес-школы МФТИ

«Самый важный мягкий навык сегодня — умение себя мотивировать»:…

В рамках школы Герман Греф, Президент, Председатель Правления Сбербанка, провел встречу со студентами. Вместе с участниками проектной школы в диалоге приняли…

Финансы, технологии и новые друзья: Серебряный клуб снова открывает…

Сбер запускает второй сезон «Серебряного клуба» — образовательного проекта для людей от 55 лет. Встречи клуба пройдут на площадках в Иркутске, Улан-Уде,…

Сбер подключил 16 новых банков к сервису оплаты через…

Сбер продолжает расширять свою экосистему QR-платежей, подключив к «платежному роумингу» по Multi-QR 16 новых банков.