Задайте любому крупному ИИ‑моделю вопрос на английском или мандаринском, и он, скорее всего, ответит бегло и с нюансами. Спросите его о чем‑то на кантонском — и начнут проявляться трещины. Именно этот разрыв и пытается устранить гонконгский стартап Hong Kong startup под названием Votee AI, создавая кантонский ИИ‑модель, предназначенный для того, чтобы обслуживать банки, университеты и государственные ведомства на языке, который крупнейшие ИИ‑лаборатории в значительной степени игнорировали.
Summary
Ключевые выводы
- Большинство ведущих ИИ‑моделей, созданных такими компаниями, как OpenAI, Anthropic, DeepSeek, Moonshot AI и Z.ai, разрабатываются в первую очередь на английском и мандаринском языках, поскольку их создатели базируются в США или материковом Китае.
- На кантонском языке говорят более чем 80 миллионов человек по всему миру, однако объем стандартизированного цифрового текста на нем значительно меньше, чем на мандаринском, что делает его классическим примером «языка с низкими ресурсами» для обучения ИИ.
- Votee AI дообучает модели с открытыми весами, такие как Llama от Meta, на кантонских данных, увеличивая свой обучающий корпус со 100 миллионов до более чем 500 миллионов токенов за счет скрейпинга, данных от сообщества и синтетических данных.
- Получающиеся модели насчитывают около 70 миллиардов параметров, что меньше передовых систем, и стоят примерно 250 000 долларов для обучения на от 500 миллионов до 1 миллиарда токенов — это лишь малая доля затрат, необходимых для англоязычных моделей.
- Компания рассматривает свою работу как часть более широкого движения «суверенного ИИ» и сейчас ведет переговоры о расширении в Юго‑Восточную Азию через AI Singapore.
Доминирование английского и мандаринского в ИИ оставляет кантонский позади
Текущий бум ИИ почти полностью опирается на два языка. По словам Пак‑Сана Тинга, генерального директора Votee AI, «вся революция ИИ происходит на английском и мандаринском», и «лишь очень малая доля приходится на другие языки». Этот дисбаланс не случаен. Компании, лидирующие в этой области — OpenAI, Anthropic, DeepSeek, Moonshot AI, Z.ai и другие, — почти все базируются в США или материковом Китае, так что неудивительно, что их флагманские модели сильнее всего на родных языках их создателей.
В результате десятки широко распространенных языков и еще больше региональных диалектов сильно отстают по уровню ИИ‑возможностей. Кантонский — наглядный пример того, насколько велик может быть этот разрыв, даже для языка, на котором ежедневно говорят десятки миллионов людей.
Почему кантонский «говорит» на другом языке, чем мандаринский
Кантонский часто описывают как «диалект» китайского, но такое обозначение занижает степень его отличия. У него иная грамматика, чем у мандаринского, и собственный словарный запас, а в Гонконге носители часто смешивают английские и кантонские слова в одном и том же предложении. Более 80 миллионов человек говорят на кантонском по всему миру — это примерно сопоставимо с числом носителей корейского и больше, чем количество людей, говорящих на итальянском или тайском.
Несмотря на такой масштаб, кантонский не породил и близко такого объема стандартизированного письменного текста, как мандаринский или английский. Бенчмарки вроде HKCanto-Eval, разработанного исследователями из Университета Кюсю и Педагогического университета Гонконга совместно с местным ИИ‑сообществом hon9kon9ize и при спонсорской поддержке Votee, показали, что мейнстримные ИИ‑модели способны более‑менее справляться с повседневным кантонским, но регулярно спотыкаются на культурных и локальных знаниях. Как говорит Тинг, кантонский «используется в образовании, здравоохранении и полицейских коммуникациях», поэтому, когда ИИ не покрывает его должным образом, «ИИ по сути бесполезен».
Подход Votee AI к созданию кантонского ИИ‑моделя
Вместо того чтобы строить модель с нуля, Votee берет существующую систему с открытыми весами, такую как Llama от Meta или Qwen от Alibaba, и интенсивно дообучает ее на данных на кантонском языке. Тинг описывает этот процесс как «по сути те же шаги, что и при обучении модели с нуля», только построенные поверх чужого фундамента. Дообученные системы затем продаются банкам, университетам и государственным ведомствам, которым нужны ИИ‑инструменты, способные работать на кантонском, а не по умолчанию переключаться на мандаринский или английский.
Сбор данных от вещателей и синтетических наборов
Создание пригодного корпуса для проекта ИИ на языке с низкими ресурсами означает сбор данных отовсюду, где их можно найти. Votee получает тексты на кантонском через онлайн‑скрейпинг, включая контент Радио и телевидения Гонконга, общественного вещателя города. Это дополняется материалами из университетов, более широкого сообщества и архивами от их прежней работы как компании в области больших данных. Там, где реальных текстов не хватает, Votee генерирует собственные синтетические наборы данных на кантонском, чтобы заполнить пробелы. В совокупности эти усилия увеличили кантонский корпус компании со 100 миллионов токенов до более чем 500 миллионов токенов.
Размер модели и затраты на обучение по сравнению с передовыми лабораториями
Итоговые модели Votee насчитывают около 70 миллиардов параметров, заметно меньше ведущих систем из топ‑лабораторий. Тем не менее, по словам Тинга, этих моделей достаточно, чтобы понимать и рассуждать на кантонском для практических задач, которые нужны клиентам. Экономика говорит сама за себя: Votee обучает свои модели на от 500 миллионов до 1 миллиарда токенов при ориентировочной стоимости около 250 000 долларов. Передовые англоязычные модели, напротив, обучаются на триллионах токенов при несоизмеримо больших расходах. Именно этот ценовой разрыв и делает более компактный, целевой кантонский ИИ‑модель коммерчески жизнеспособным даже для стартапа, а не только для технологического гиганта.
Такая структура затрат важна и за пределами самой Votee. Она показывает, что для обслуживания рынка ИИ на языке с низкими ресурсами не нужны миллиарды, вкладываемые в передовые лаборатории, — достаточно рабочей базовой модели с открытыми весами, надежного конвейера данных и небольшой доли вычислительных ресурсов. Это значимый сигнал для других недостаточно обслуживаемых языков, которые наблюдают за развитием кантонского ИИ.
Суверенный ИИ и выход в Юго‑Восточную Азию
Работа Votee вписывается в более широкий тренд, известный как суверенный ИИ: идея о том, что правительства и компании хотят владеть собственными данными, моделями и инфраструктурой, а не полностью зависеть от поставщиков за рубежом. «ИИ стал настолько насущной потребностью, что вы не хотите быть привязаны к кому‑то, кто может его отключить», — говорит Тинг.
Владеть стеком, хотя бы частично
Тинг прямо говорит, что наиболее полная версия суверенного ИИ, при которой страна контролирует каждое звено цепочки поставок ИИ, на практике «очень трудна» для достижения. Его более реалистичное предложение состоит в том, что акцент государств делается на владении как базовыми фундаментальными моделями, так и программными решениями, построенными на их основе. Он также отмечает, что правительствам редко нужна мощность уровня передовых моделей для автоматизации конкретных задач — даже модель всего с 1 миллиардом параметров может подойти для более узких государственных сценариев, или же меньший слой на локальном языке может просто маршрутизировать выводы от более крупной модели на английском или китайском.
Партнерства по оборудованию и планы на будущее
Votee не ограничивается одной экосистемой. По словам Тинга, компания работает с моделями от MiniMax и SenseTime и может запускать операции на чипах Nvidia. «Мы можем использовать чипы Nvidia, можем использовать модель Moonshot или DeepSeek, — говорит он. — Мы как тот человек в старшей школе, который дружит со всеми». Votee описывает себя как прибыльную в том смысле, что ее доходы превышают расходы, финансируемую в основном за счет клиентских контрактов, и называет гонконгского магната Аллана Зимана, известного развитием ночного района Лан Квай Фонг в городе, своим советником.
Амбиции компании теперь выходят за пределы Гонконга. Тинг говорит, что Votee ведет активные переговоры с AI Singapore и планирует дальнейшую экспансию по всей Юго‑Восточной Азии. Он также нацелен на более долгосрочную цель: использовать ИИ для помощи в защите исчезающих языков в регионах, включая Восточную Азию, Северную Америку и Африку. Тинг формулирует ставки предельно жестко, называя доминирование англоязычного ИИ «моментом пишущей машинки», когда рост производительности настолько велик, что люди отказываются от собственного языка просто чтобы не отставать. «Люди будут переходить на английский только потому, что производительность “пишущей машинки” настолько выше, чем у их собственного языка», — говорит он. Останется ли 70‑миллиардный кантонский ИИ‑модель достаточно весомым противовесом этому притяжению — вопрос открытый, но для Тинга мотивация уходит глубже, чем доля рынка. «С каждой умирающей языковой культурой вы теряете еще один способ видеть мир», — говорит он.
FAQ
Почему Votee AI сосредоточена на кантонском языке при разработке ИИ‑моделей?
Потому что кантонский, на котором говорят более 80 миллионов человек, существенно отличается от мандаринского и слабо обслуживается ИИ, что влияет на такие сферы, как образование и здравоохранение, где критически важны точные инструменты на местном языке.
Как Votee AI создает свои кантонские ИИ‑модели?
Votee AI дообучает модели с открытыми весами от разработчиков, таких как Meta, используя данные на кантонском, собранные с помощью скрейпинга, от сообществ, университетов и синтетических наборов данных, увеличивая свой корпус со 100 миллионов до более чем 500 миллионов токенов.
Что такое суверенный ИИ и как Votee AI соотносится с этой концепцией?
Суверенный ИИ означает, что правительства и компании владеют своими данными, моделями и инфраструктурой ИИ, а не полагаются полностью на зарубежных поставщиков. Votee AI поддерживает эту идею, локализуя ИИ‑модели для кантонского языка и сотрудничая с местными и глобальными поставщиками оборудования и моделей.
Каковы планы Votee AI по региональной экспансии?
Votee AI ведет активные переговоры с AI Singapore и планирует расширяться в Юго‑Восточную Азию, а также изучает, как ИИ может помочь в защите исчезающих языков в других частях мира.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Почему Votee AI сосредоточена на кантонском языке при разработке ИИ‑моделей?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Потому что кантонский, на котором говорят более 80 миллионов человек, существенно отличается от мандаринского и слабо обслуживается ИИ, что влияет на такие сферы, как образование и здравоохранение, где критически важны точные инструменты на местном языке.»}},{«@type»:»Question»,»name»:»Как Votee AI создает свои кантонские ИИ‑модели?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Votee AI дообучает модели с открытыми весами от разработчиков, таких как Meta, используя данные на кантонском, собранные с помощью скрейпинга, от сообществ, университетов и синтетических наборов данных, увеличивая свой корпус со 100 миллионов до более чем 500 миллионов токенов.»}},{«@type»:»Question»,»name»:»Что такое суверенный ИИ и как Votee AI соотносится с этой концепцией?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Суверенный ИИ означает, что правительства и компании владеют своими данными, моделями и инфраструктурой ИИ, а не полагаются полностью на зарубежных поставщиков. Votee AI поддерживает эту идею, локализуя ИИ‑модели для кантонского языка и сотрудничая с местными и глобальными поставщиками оборудования и моделей.»}},{«@type»:»Question»,»name»:»Каковы планы Votee AI по региональной экспансии?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Votee AI ведет активные переговоры с AI Singapore и планирует расширяться в Юго‑Восточную Азию, а также изучает, как ИИ может помочь в защите исчезающих языков в других частях мира.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

