Google DeepMind представила новую форму перевода на ИИ с жестового языка, которая позволяет глухим и слабослышащим пользователям использовать жесты напрямую перед телефоном вместо ввода текста, и компания называет это настоящим прорывом в технологиях доступности. Модель, представленная 12 августа 2026 года, называется SL2T — сокращение от sign-language-to-text (жестовый язык в текст) — и это первый случай, когда подобная технология выходит за пределы исследовательских лабораторий и попадает в повседневные потребительские приложения, такие как Gboard и Live Transcribe.
Summary
Ключевые моменты
- Google DeepMind запустила SL2T, многоязычную модель жестового языка, которая преобразует жесты напрямую в письменный текст.
- В настоящее время она поддерживает перевод американского жестового языка (ASL) на английский внутри Gboard и Live Transcribe на Pixel 11 без дополнительной платы.
- Модель была обучена на более чем 100 000 часов данных по более чем 50 жестовым языкам и набирает 70 BLEURT на бенчмарке FLEURS-ASL, что значительно выше предыдущих моделей.
- SL2T отслеживает ориентиры позы вместо необработанного видео для защиты конфиденциальности пользователей, немедленно удаляя отснятый материал с камеры.
- Члены сообщества глухих участвовали в проекте с самого начала, а Google создала Консультативный комитет по ИИ и жестовым языкам (AI Sign Language Advisory Committee, AISLAC), чтобы направлять его внедрение.
Google DeepMind запускает SL2T, многоязычную модель ИИ для перевода жестового языка
SL2T — это ответ DeepMind на пробел, который существовал в ИИ годами: в то время как инструменты для устной речи, такие как диктовка и автоматический перевод, стали мейнстримом за последние два десятилетия, более 200 жестовых языков мира — которыми, по оценкам, пользуются 70 миллионов глухих и слабослышащих людей — в значительной степени оставались в стороне. DeepMind описывает SL2T как «масштабно многоязычную» систему, созданную для устранения этого разрыва за счет значительного скачка как в качестве перевода, так и в охвате языков.
Практический результат — новый вид диктовки. Так же как слышащие пользователи могут говорить вместо набора текста, SL2T позволяет глухим пользователям использовать жесты перед телефоном везде, где они обычно печатают — при поиске в интернете, написании сообщений или документов или при обращении к Gemini с просьбой выполнить задачу. Внутри Live Transcribe пользователи могут «произносить» свою часть разговора жестами вместо того, чтобы набирать текст в переписке со слышащим человеком. По словам собственных тестировщиков Google, использование ASL жестами казалось быстрее и естественнее, чем набор эквивалентного текста на английском.
Поддержка ASL в Gboard и Live Transcribe на Pixel 11
Пока что технология поддерживает одну языковую пару: американский жестовый язык, переводимый на английский. Сначала она доступна внутри Gboard и Live Transcribe на Pixel 11, и Google обещает, что вскоре появятся больше устройств и дополнительные жестовые языки. Важно, что эта функция предлагается пользователям без дополнительной платы, позиционируясь как стандартная функция доступности, а не как премиальная опция.
Как была создана многоязычная модель жестового языка
SL2T была обучена на наборе данных более чем из 100 000 часов, охватывающем более 50 жестовых языков, при этом примерно четверть этих данных приходится специально на ASL. Обучение модели сразу на множестве языков и уровней владения, а не создание отдельных однопрофильных систем для каждого языка, помогло ей выучить общие структуры, что улучшило общую производительность — модель превзошла однопрофильные модели в собственных тестах DeepMind.
Этот масштаб отражается в цифрах. На бенчмарке FLEURS-ASL, который измеряет качество перевода с ASL на английский, SL2T показала показатель zero-shot в 70 BLEURT — цифру, которую DeepMind называет значительно более высокой, чем все ранее опубликованные результаты для подобных задач. Этот разрыв важен: он показывает, что SL2T — не просто постепенное улучшение, а качественный скачок в том, насколько хорошо ИИ может понимать жестовый язык как полноценный язык, а не как серию жестов руками, сопоставленных со словами.
Часть сложности заключается в том, что жестовые языки — это не просто устная речь, выполняемая руками. У них есть собственная грамматика, словарь и структура, и они передают смысл через одновременное движение рук, рук (предплечий), корпуса, головы и лица. Отслеживание всего этого в реальном времени — сложная задача компьютерного зрения, и это одна из причин, по которой более ранние попытки — например, перчатки для жестового языка — испытывали трудности, поскольку рассматривали жесты как узкую задачу отслеживания рук, а не как полноценный перевод языка.
Ориентиры позы защищают конфиденциальность пользователей жестового языка
Вместо отправки необработанного видео на сервер SL2T обрабатывает жесты как поток координат ориентиров позы. Встроенная в устройство модель под названием MediaPipe Holistic отслеживает точки на теле пользователя, и только эти геометрические координаты — а не сам видеопоток с камеры — отправляются для перевода. Исходное видео немедленно удаляется, что является способом DeepMind встроить защиту конфиденциальности прямо в архитектуру системы, а не рассматривать ее как второстепенный аспект.
Отказ от глосс для повышения точности прямого перевода
SL2T также отходит от распространенного подхода в ранних исследованиях жестовых языков: она переводит последовательности координат напрямую в текст, обходя промежуточные пошаговые аннотации, известные как «глоссы». Глоссы, как правило, упускают более богатые, нелинейные элементы жестовых языков, включая мимику и пространственные конструкции, которые несут реальный смысл. Отказавшись от этого шага, SL2T избегает искусственных ограничений словаря и позволяет качеству перевода напрямую расти по мере увеличения объема данных.
Google также заявляет, что работала над практическими, реальными задачами, выходящими за рамки бенчмарков, — сокращением задержки потоковой передачи, предотвращением ложных переводов, когда человек на самом деле не использует жесты, и целенаправленным повышением точности для примерно 10% пользователей, которые являются левшами, а также для людей, использующих жесты одной рукой, держа телефон в другой.
Сообщество глухих сформировало разработку SL2T
DeepMind представляет этот проект как созданный вместе с сообществом глухих, а не просто для него. Идея принадлежит Сэму Сепаху, глухому сотруднику Google, и партнеры из числа глухих участвовали в сборе данных, пользовательском тестировании и оценке реального влияния технологии.
Чтобы сохранить эту структурированную вовлеченность и после первоначального запуска, Google сформировала Консультативный комитет по ИИ и жестовым языкам (AI Sign Language Advisory Committee, AISLAC), объединив глобальные организации глухих и профильных экспертов, чтобы помочь направлять внедрение технологии в будущем. Компания также совместно с партнерами из сообщества подготовила совместный отчет о влиянии для этого первого релиза, в котором изложено как то, что SL2T уже умеет, так и ее текущие ограничения — подход, который, по словам Google, она намерена повторять для будущих релизов, связанных с жестовыми языками.
Что дальше для ИИ-перевода жестового языка
DeepMind рассматривает поддержку ASL как отправную точку, а не финишную черту. Команда заявляет, что работает над расширением SL2T на дополнительные жестовые языки, исследует генерацию жестового языка — по сути, обратный процесс преобразования текста в жестовый вывод — и добавляет более продвинутые возможности ИИ поверх существующей модели.
Более широкие амбиции связаны с давней целью Google сделать информацию универсально доступной. Достижение этого для сообществ глухих означает приближение жестовых языков к паритету с устными и письменными языками во всех цифровых продуктах, а не просто выпуск одной функции на одном устройстве. То, сохранятся ли ранние результаты SL2T для ASL по мере расширения на десятки других жестовых языков, каждый со своей грамматикой и региональными вариациями, вероятно, определит, насколько быстро это более широкое видение станет реальностью для пользователей за пределами Pixel 11.
FAQ
Что такое SL2T и что она делает?
SL2T — это многоязычная модель Google DeepMind для преобразования жестового языка в текст. Она переводит жесты напрямую в письменный текст, позволяя глухим пользователям использовать жесты перед телефоном, чтобы набирать сообщения, выполнять поиск или общаться вместо использования клавиатуры.
Какие жестовые языки SL2T поддерживает в настоящее время?
Сейчас SL2T поддерживает только американский жестовый язык, переводимый на английский, и доступна через Gboard и Live Transcribe на Pixel 11. Дополнительные жестовые языки планируются в будущих релизах.
Как SL2T защищает конфиденциальность пользователей при переводе жестового языка?
SL2T использует встроенную в устройство систему отслеживания, которая считывает точки на теле пользователя жестового языка вместо отправки необработанного видео куда-либо. Для перевода используются только эти координаты, а сам видеопоток с камеры немедленно удаляется.
Как сообщество глухих участвует в проекте SL2T?
Глухие люди были вовлечены с самых ранних этапов концепции до сбора данных, тестирования и управления проектом. Google также создала Консультативный комитет по ИИ и жестовым языкам, состоящий из организаций глухих и экспертов, чтобы помогать направлять дальнейшее развитие технологии.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Что такое SL2T и что она делает?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»SL2T — это многоязычная модель Google DeepMind для преобразования жестового языка в текст. Она переводит жесты напрямую в письменный текст, позволяя глухим пользователям использовать жесты перед телефоном, чтобы набирать сообщения, выполнять поиск или общаться вместо использования клавиатуры.»}},{«@type»:»Question»,»name»:»Какие жестовые языки SL2T поддерживает в настоящее время?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Сейчас SL2T поддерживает только американский жестовый язык, переводимый на английский, и доступна через Gboard и Live Transcribe на Pixel 11. Дополнительные жестовые языки планируются в будущих релизах.»}},{«@type»:»Question»,»name»:»Как SL2T защищает конфиденциальность пользователей при переводе жестового языка?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»SL2T использует встроенную в устройство систему отслеживания, которая считывает точки на теле пользователя жестового языка вместо отправки необработанного видео куда-либо. Для перевода используются только эти координаты, а сам видеопоток с камеры немедленно удаляется.»}},{«@type»:»Question»,»name»:»Как сообщество глухих участвует в проекте SL2T?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Глухие люди были вовлечены с самых ранних этапов концепции до сбора данных, тестирования и управления проектом. Google также создала Консультативный комитет по ИИ и жестовым языкам, состоящий из организаций глухих и экспертов, чтобы помогать направлять дальнейшее развитие технологии.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

