«Говори и переводи»: Alibaba выпустила Qwen3.5-LiveTranslate с визуальным интеллектом
19 мая 2026 года Alibaba представила Qwen3.5-LiveTranslate — новую модель реального времени для аудио- и видео-перевода, которая не просто слышит, но и видит. Разработанная лабораторией Tongyi Lab, модель поддерживает перевод между более чем 3 500 языковыми парами и впервые в серии Qwen объединяет обработку речи, изображений и видео в едином потоке KuCoin News. В отличие от большинства традиционных систем синхронного перевода, которые полагаются исключительно на аудиоданные, Qwen3.5-LiveTranslate анализирует визуальный контекст: движения губ, жесты, отображаемые на экране надписи и объекты MarkTechPost.
🎯 Что умеет Qwen3.5-LiveTranslate?
Модель работает через WebSocket-протокол в рамках сервиса Alibaba Cloud Model Studio. API-доступ планируется к открытию в ближайшее время.
Ключевые возможности:
- Реальное время: задержка перевода составляет 2,8 секунды, что сравнимо с отраслевыми стандартами синхронного перевода. Технология достигается за счёт «смыслового предиктивного чтения» (semantic unit prediction) — модель выдает перевод, не дожидаясь окончания всего предложения MarkTechPost.
- Визуальное усиление: модель анализирует визуальные подсказки: движения губ, жесты, текст на экране и объекты. Это помогает устранить семантическую неоднозначность. Например, в сцене с медицинской маской система различает «medical mask» и «masquerade mask» MarkTechPost.
- Клонирование голоса: впервые в серии Qwen модель поддерживает реальное клонирование голоса — перевод звучит голосом оригинального спикера. Для клонирования достаточно всего одного предложения от говорящего KuCoin News.
- Динамические горячие слова: можно подгружать словарь специфических терминов (например, медицинских или юридических) для повышения точности перевода в профессиональной среде.
🔧 Технические параметры и архитектура
Модель базируется на архитектуре Qwen3.5-Omni, построенной вокруг моделей Qwen3.5. Ключевые характеристики Alibaba Cloud Help Center:
| Параметр | Значение |
|---|---|
| Входные языки | 60 языков |
| Выходные языки (текст) | 60 языков |
| Выходные языки (голос) | 29 языков (включая русский, английский, китайские диалекты и др.) |
| Общее число языковых пар | 3 500+ |
| Задержка перевода | 2,8 секунды |
| Тип подключения | WebSocket (аудио- и видеопоток) |
| Языки вывода голоса | 29 (с возможностью клонирования голоса) |
Qwen3.5-LiveTranslate понимает 60 языков (вход) и генерирует текст на этих же 60 языках, а «живую» речь выдает на 29 языках (включая русский, английский, китайские диалекты, основные европейские и азиатские языки) Alibaba Cloud Help Center.
🏢 Где может пригодиться?
Модель ориентирована на корпоративных пользователей и разработчиков. Примеры применения MarkTechPost:
- Синхронный перевод на международных конференциях: участники говорят на разных языках, но слышат знакомые голоса коллег.
- Автоматический перевод видеоконтента: создание субтитров и озвучки для международных релизов.
- Обучение и тренинги с голосовым сопровождением: диктор говорит на одном языке, а слушатели слышат перевод его же голосом.
- Мультиязычная поддержка в колл-центрах: оператор общается с клиентом на разных языках без смены сотрудника.
💎 Итог
Qwen3.5-LiveTranslate — это не просто обновление языковой модели, а значительный шаг к созданию естественного и невидимого перевода, где технологии буквально исчезают за голосом человека. Для разработчиков и бизнеса это готовый инструмент, способный устранить языковой барьер с минимальной задержкой и сохранением индивидуальности говорящего KuCoin News.
Следим за развитием событий, команда AIDLSS