• 7 октября, 2024

GigaChat научился распознавать изображения

Нейросетевая модель GigaChat Pro обрела новую модальность. Теперь в качестве запроса пользователь может отправить иллюстрацию, чтобы сервис использовал её как дополнительный контекст. Модель определит, сколько людей на фото, во что они одеты, даст совет по стилю одежды и многое другое.

Также модель научилась распознавать печатный и рукописный текст, формулы, графики, таблицы и анализировать данные, которые в них содержатся. Например, студенты могут сфотографировать часть учебного материала или конспекта, загрузить изображение и в несколько кликов получить короткое содержание текста, его ключевую тему и сформировать план дальнейшей работы с ним.

Функциональность доступна и бизнес-клиентам через API. Компании могут использовать искусственный интеллект в ещё большем числе сценариев: модерировать и классифицировать отзывы, систематизировать медиаконтент, автоматизировать линию поддержки (когда клиент прикладывает к обращению скрин или фото). Ретейлеры могут загружать изображение товара и просить сервис придумать к нему продающее описание.

Также в четыре раза был увеличен размер контекста как GigaChat Pro, так и версии GigaChat Lite — с 8 тыс. до 32 тыс. токенов. Если раньше в один запрос можно было загрузить объём текста, сопоставимый с 15 страницами A4 (шрифт 14 pt), то теперь максимальный объём запроса вырос до 60 страниц. Кроме того, у моделей повысился уровень математических знаний, а GigaChat Pro научился лучше форматировать текст — расставлять параграфы, заголовки, используя выделения и списки.

Андрей Белевцев, старший вице-президент, руководитель блока «Технологическое развитие» Сбербанка:

«Мультимодальность расширяет способы и сферы применения больших языковых моделей, она же — ключевой тренд развития генеративного искусственного интеллекта. Теперь GigaChat умеет распознавать изображения — и это не просто ещё один важный шаг в развитии нашего сервиса, он открывает широкий спектр новых возможностей для наших пользователей. В том числе появляется много сценариев использования GigaChat API для бизнеса. Кроме того, увеличение размера контекста системы в четыре раза позволит поддерживать более длинные диалоги с пользователями и проще реализовывать кейсы с механикой RAG».

Похожие статьи

СберМобайл и СберСтрахование застрахуют экраны детских смартфонов

СберМобайл совместно со СберСтрахованием запустил акцию для детей. При подключении тарифа СберKids можно бесплатно защитить экран смартфона на случай повреждений.

На сессии AI Journey на ВЭФ-2025 обсудят эволюцию развития…

Генеративный искусственный интеллект (GenAI) продолжает менять мир, и следующий этап эволюции — рассуждающие и самообучающиеся системы.

Учёные Сбера предложили новый способ борьбы с галлюцинациями моделей…

Исследователи Центра практического искусственного интеллекта Сбербанка разработали метод, который значительно снижает риски галлюцинаций больших языковых моделей (LLM).