Google научила ИИ понимать язык, а не только переводить текст
Google расширила языковые модели до 300+ языков, объединив перевод, распознавание речи и эмоций в единую систему на базе Gemini.
Google рассказала, как её технологии сейчас работают с более чем 300 языками. На них говорят свыше 7 миллиардов человек — 86% населения планеты. Компания называет это промежуточным итогом многолетней работы: от классического Google Translate до новых моделей семейства Gemini, которые понимают не только слова, но и интонацию, паузы, смешение языков в одной фразе и эмоцию говорящего.
Для владельца бизнеса это не абстрактная новость о лингвистике. Речевой и текстовый ИИ встроен в поиск, карты, рекламные инструменты, голосовых помощников и переводчики, которыми пользуются ваши клиенты и вы сами. Если технология стала точнее понимать живую речь на десятках языков, это меняет то, как люди ищут товары голосом, как работает автоперевод отзывов и описаний, как звучит реклама в разных странах. И где-то в этом есть практическая польза, а где-то — повод присмотреться к деталям, прежде чем радоваться.
Что изменилось: от перевода текста к пониманию речи
Как пишет Google, раньше распознавание речи строилось по жёсткой схеме: сначала аудио переводили в текст, потом текст обрабатывали, потом снова превращали в звук. Такой конвейер работал, но терял самое важное — тон, темп речи, эмоции, контекст. Люди не говорят идеальными грамматическими фразами: смеются, перебивают друг друга, запинаются, смешивают языки внутри одной фразы — как в спэнглише или хинглише.
Чтобы это учитывать, компания перешла к тому, что называет «нативным аудиоинтеллектом»: модели, в том числе Gemini, обучены обрабатывать звук напрямую, без промежуточного превращения в сухой текст. По данным Google, из этого выросли конкретные инструменты:
— Gemini 3.5 Live Translate — перевод речи в реальном времени на 70 языков и более 2000 языковых пар, с распознаванием переключения между языками и эмоциональных оттенков. — Gemini 3.5 Transcribe — самая точная на сегодня модель речь-в-текст у компании: она превращает сырой звук в аккуратный текст даже в шумной обстановке или со сложной терминологией. На ней работает функция Rambler в Gboard на Android: она убирает слова-паразиты, исправляет грамматику и пунктуацию, позволяет редактировать текст голосом и переключаться между языками на ходу.
Для бизнеса это означает, что голосовой поиск, голосовые заметки, автоматическая транскрипция звонков и совещаний становятся заметно точнее. Это особенно заметно, если клиенты говорят с акцентом, смешивают языки (например, русский с казахским или украинским) или общаются в шумном помещении, как это часто бывает в рознице и сфере услуг.
Инициатива «1000 языков» и почему это касается не только редких наречий
Google объявила цель — поддержать 1000 самых распространённых языков мира, а не только те, где ИИ уже работает хорошо. Проблема в том, что интернет и большинство обучающих данных смещены в сторону нескольких доминирующих языков, а остальные представлены плохо или вообще отсутствуют в цифровом мире.
Чтобы решить эту задачу, Google обучила Universal Speech Model на 12 миллионах часов аудио и применила технику переноса знаний между языками: модель учится на языках, где данных много, и применяет найденные закономерности к языкам, где данных мало. По данным компании, работа опирается на 25 лет открытых исследований и более 400 научных публикаций по речевым технологиям.
Параллельно Google выстраивает партнёрства с местными сообществами для сбора данных «с земли»:
— WAXAL — открытый набор речевых данных по 27 языкам Африки южнее Сахары, на которых говорят более 100 миллионов человек в 26+ странах. Проект сделан вместе с Makerere University и Digital Umuganda и специально фиксирует тональные особенности и ритм разговорной речи, которые обычно теряются в стандартных наборах данных. — Project Vaani — совместно с Индийским институтом науки (IISc) и организацией Bhashini собрано свыше 30 000 часов речи на 109 языках от более 155 000 говорящих; картография строится не по языкам, а по регионам Индии. — Amplify Initiative — более 1600 местных экспертов и 20 университетов на четырёх континентах, включая UFMG в Бразилии, IIT Kharagpur в Индии и Makerere University в Уганде, собрали 15 000 мультимодальных точек данных с локальными особенностями.
Ещё один инструмент — Language Explorer, визуализация базы LinguaMeta. Google называет её крупнейшим открытым репозиторием языковых данных в мире: она охватывает более 7000 устных, письменных и жестовых языков.
Прямого отношения к языкам СНГ в этом списке нет, но принцип важен: там, где раньше ИИ работал плохо из-за нехватки данных, качество будет расти быстрее за счёт переноса знаний между языками.
Работа без интернета и с простыми телефонами
Отдельная часть публикации касается доступности. По данным Google со ссылкой на исследование Forbes, более 3 миллиардов человек всё ещё не имеют надёжного доступа к интернету. Технология работает по-настоящему только там, где она доступна в реальных условиях — а не только в демо с быстрым Wi-Fi.
Для этого Google выпустила TranslateGemma — семейство лёгких моделей перевода, построенных на основе Gemini и обученных на 55 языках. Модель работает прямо на устройстве, без облака и без подключения к интернету, что важно для регионов с плохим покрытием сети.
Даже лёгкие модели требуют определённого уровня устройства, а сотни миллионов людей до сих пор используют простые кнопочные телефоны. Здесь Google поддерживает проект Viamo и его сервис «Ask Viamo Anything» (AVA) — голосового ИИ-помощника на базе Gemini, который работает через обычные звонки на кнопочный телефон. По данным компании, в Руанде сервис уже ответил на более 2 миллионов вопросов пользователей.
Жестовый язык и культурный контекст
Google отдельно отмечает, что язык — это не только диалекты и словарный запас, но и другие способы общения, которые традиционные речевые инструменты обычно игнорируют, вынуждая людей подстраиваться под технологию, а не наоборот.
Один из ответов на это — Sign Language-to-Text (SL2T), модель, обученная на более чем 50 жестовых языках. Она включена в функцию рукописного ввода жестами в Gboard и в Live Transcribe на Pixel 11, пока для пары американский жестовый язык — английский. Google описывает это как первый шаг к тому, чтобы сделать продукты доступнее для 70 миллионов человек в мире, которые общаются жестовым языком.
Похожий подход применён к произношению географических названий. В Новой Зеландии компания работала с экспертами по языку маори, чтобы Google Карты правильно произносили местные названия — неправильное произношение не просто путает пользователя, но и обесценивает культурное наследие места. Правильные, культурно точные произношения встроены прямо в модели синтеза речи.
Что это значит для небольшого бизнеса в России и СНГ
Прямых продуктов для русского языка в публикации не упомянуто, но общая логика касается любого бизнеса, чьи клиенты пользуются голосовым поиском, автопереводом или общаются с компанией не на литературном языке, а так, как говорят в жизни — с акцентом, диалектизмами, смешением языков.
Что стоит сделать на этой неделе:
— Проверьте, как звучит ваш бизнес в голосовом поиске. Спросите вслух у Google Ассистента или через голосовой ввод то, что мог бы спросить клиент: «где купить [товар] в [город]», «сколько стоит [услуга]». Если ответ неточный или бизнес не находится — это сигнал поправить описания на сайте и в карточках компании простыми разговорными формулировками, а не только формальными названиями услуг. — Если у вас интернет-магазин или сайт с описаниями на нескольких языках (русский, казахский, украинский, узбекский и так далее), проверьте автоматические переводы отзывов и карточек товаров. Качество распознавания смешанной речи растёт, и это стоит учитывать при обновлении контента для разных аудиторий. — Если бизнес работает с клиентами через звонки — колл-центр, служба поддержки, приём заказов по телефону — оцените инструменты автоматической транскрипции разговоров. Точность распознавания в шумной обстановке и со специфическими терминами (медицинскими, техническими, отраслевыми) заметно выросла, и это может ускорить обработку заявок и контроль качества звонков без лишних затрат на ручную расшифровку. — Если ваша аудитория — в регионах с нестабильным интернетом или люди, привычные к простым телефонам, не рассчитывайте на сложные голосовые сценарии как единственный канал. Держите текстовые и офлайн-альтернативы: SMS, простые IVR-меню, печатные материалы. Технология для таких сценариев ещё догоняет. — Название вашей компании, товара или улицы, на которой расположен магазин, может произноситься неправильно в навигаторах и голосовых помощниках. Это не критично для крупного бизнеса, но для локальной торговли и услуг стоит проверить, как звучит адрес в Google Картах, и поправить транслитерацию, если она искажает название до неузнаваемости.
Подвох в том, что рост точности ИИ на «больших» языках происходит быстрее, чем на языках народов России и СНГ за пределами русского — украинского, казахского, узбекского и других. Данных на них объективно меньше, и хотя Google описывает технику переноса знаний между языками как способ сократить разрыв, результат для конкретного региона может появиться позже, чем для языков с большим числом носителей и данных.
Итог
Google описывает переход от перевода текста к пониманию живой речи — с эмоциями, паузами, смешением языков и культурным контекстом. Это отражается в конкретных продуктах: Gemini 3.5 Live Translate, Gemini 3.5 Transcribe, TranslateGemma, Sign Language-to-Text, а также в масштабных партнёрствах по сбору данных для языков, которые раньше были плохо представлены в цифровом мире.
Для бизнеса в России и СНГ прямой пользы от этих конкретных проектов пока нет — они нацелены на другие регионы. Общий тренд всё же стоит учитывать при планировании голосового поиска, автоперевода контента и обработки звонков: точность распознавания разговорной, смешанной и нестандартной речи растёт, и есть смысл заранее проверить, как в этих системах выглядит именно ваш бизнес.