Абстрактный тёмно-бирюзовый фон: светящиеся волны звука сходятся в одну точку света — символ 13 новых голосовых моделей на Ropewalk одним пакетом
9 мин чтения

19 новых моделей Ropewalk: волна голосов (сен 2026)

На 38-й неделе на Ropewalk вышли 19 новых моделей: три текстовых флагмана, два тира GPT Image 2.5, новая видеомодель и крупнейшая волна голосов — 13 TTS-моделей разом.

Экспертная команда о новейших ИИ-технологиях и генеративных моделях

19 новых моделей Ropewalk: волна голосов (сен 2026)

За 16-17 сентября 2026 года на Ropewalk вышли сразу 19 новых моделей, и тринадцать из них — совершенно новые голоса: это самая крупная партия TTS-моделей, которую платформа когда-либо добавляла за один заход. Разбираем, что для чего годится и с чего начать: три свежих текстовых тира, два новых уровня GPT Image 2.5, первая модель на базе Wan 3.0 для видео и та самая волна из 13 голосовых моделей.

Автор: команда Ropewalk AI. Протестировано 2026-09-18 на реальных генерациях по всему релизу — настоящее изображение от GPT Image 2.5 Flare и настоящий голосовой клип от Grok Voice TTS 1.0, оба доступны по ссылкам ниже.

Коротко

На этой неделе вышло 19 моделей: Gemini 3.8 Flash, Gemini 3.1 Pro и Meta Muse Spark 1.3 для текста; GPT Image 2.5 Flare и Sunburst для изображений; Wan 3.0 для видео; и 13 голосовых моделей — от Grok Voice TTS до MiniMax Speech 2.8 HD — пришедших одним пакетом. Большинству стоит начать с Kokoro 82M для почти бесплатной озвучки или с MiniMax Speech 2.8 HD, когда голос должен звучать как студийная запись.

Новые флагманские текстовые тиры

На этой неделе в каталог добавились три текстовые модели — от помощи в агентном кодинге до координации нескольких агентов. Gemini 3.8 Flash — самая умная Flash-модель Google, доступна за за сообщение, с окном контекста 1,05 млн токенов и заметным приростом над версией 3.7 Flash в задачах по разработке ПО и многошаговых рассуждениях. Gemini 3.1 Pro — текущий флагман Google Pro-уровня, тоже обновлённый именно на этой неделе, за за сообщение и с окном в 1 млн токенов для более глубокой аналитической работы. Meta Muse Spark 1.3 — омни-модальная модель Meta с поддержкой текста, изображений, видео, аудио и файлов на входе, заточенная под длинные агентные и мультиагентные сценарии: по данным Meta, она делает примерно на 20% меньше вызовов инструментов, чем версия 1.2, при цене за сообщение.

Два новых тира GPT Image 2.5

Семейство GPT Image 2.5 от OpenAI разделилось на два тира на этой неделе — оба вышли 2026-09-08 и оба стартуют от за генерацию на низком качестве. GPT Image 2.5 Flare — быстрый тир по умолчанию: на 50% ниже задержка, чем у обычного GPT Image 2, при более высоком качестве, рассчитан на повседневную генерацию и поддерживает до 16 референсных изображений для редактирования. Мы прогнали через Flare промпт со сценой в кафе как живой тест: генерация списала 55 гемов на настройках по умолчанию и вернула кадр ниже меньше чем за 15 секунд. GPT Image 2.5 Sunburst — более тяжёлый прецизионный тир, который жертвует скоростью ради более точного контроля над правками и сохранением объекта — выбор для продакшена, где важнее консистентность по всей партии, а не скорость.

Wan 3.0 пополняет видеолинейку

Wan 3.0 — новейшая модель Alibaba для генерации видео из текста и из изображения: клипы от 480p до полного 1080p с кинематографичным движением и длительностью до 30 секунд, от за генерацию, пока действует стартовая скидка до конца месяца. Это единственная новая видеомодель в этой партии, и среди видеолинейки Ropewalk она сейчас держит планку по разрешению от Alibaba — пригодится, когда проекту реально нужен 1080p, а не 480-720p, на которых обычно останавливаются бюджетные видеомодели.

Волна голосов: 13 TTS-моделей одним пакетом

2026-09-17 вышли сразу тринадцать моделей синтеза речи — самое крупное расширение голосов за один день в истории Ropewalk, от пяти разных лабораторий и с разбросом цен от до за строку в зависимости от длины и уровня голоса. Grok Voice TTS 1.0 — модель xAI с пятью выразительными английскими голосами (Eve, Ara, Rex, Sal, Leo); ниже мы сгенерировали ею настоящий клип, списавший за строку из 170 символов. MiniMax Speech 2.8 HD — студийный верхний уровень линейки, использующий ту же системную библиотеку голосов MiniMax, что и более быстрый тир Turbo под ним. Kokoro 82M — открытая бюджетная модель: 54 голоса на восьми языках за доли цента на 1000 символов, и самая дешёвая модель во всём этом релизе со стартовой ценой . Остальные распределились между Microsoft (MAI Voice 2 и её Flash-тир), Mistral (Voxtral Mini TTS, 30 пресетов «голос+эмоция»), Deepgram (Aura 2, 90 голосов на восьми языках), Alibaba (Qwen Audio 3.0 TTS Flash и Plus, двуязычные китайский/английский), Fish Audio (S2 Pro), Sesame (CSM 1B, открытая модель, лежащая в основе голосовых компаньонов Sesame) и Canopy Labs (Orpheus 3B, семь эмоциональных голосов).

Какую модель под какую задачу

Задача Модель Почему
Агентный кодинг / ревью PR Gemini 3.8 Flash Контекст 1,05М, /сообщение, заточена под многошаговые рассуждения
Глубокий research / длинные документы Gemini 3.1 Pro Контекст 1М, глубина рассуждений уровня Pro
Оркестрация мультиагентных сценариев Meta Muse Spark 1.3 Омни-модальный вход, ~20% меньше вызовов инструментов, чем у 1.2
Повседневная генерация изображений GPT Image 2.5 Flare На 50% ниже задержка, чем у GPT Image 2, старт от
Продакшен / консистентность партии GPT Image 2.5 Sunburst Более точный контроль правок, сохранение объекта
Текст-в-видео, 1080p Wan 3.0 До 30 секунд, 480p-1080p, действует стартовая скидка
Самая дешёвая озвучка Kokoro 82M Старт от , 54 голоса, 8 языков
Студийное качество озвучки MiniMax Speech 2.8 HD Полная системная библиотека голосов, HD-тир
Озвучка с эмоциональными пресетами Voxtral Mini TTS 30 пресетов «голос+эмоция»

Попробуйте прямо сейчас

Все 19 моделей уже доступны на Ropewalk без листа ожидания. Если пробовать только одно из этой подборки — начните с волны голосов: это самое крупное добавление недели, а Kokoro 82M стоит копейки для экспериментов — за строку. Из текстовых моделей лучший вариант по умолчанию — Gemini 3.8 Flash: дешевле Gemini 3.1 Pro ( против за сообщение) и при этом хватает контекста и глубины рассуждений для реальных агентных задач. Для работы с изображениями начните с GPT Image 2.5 Flare — та же стартовая цена , что и у Sunburst, но заметно быстрее; переходите на Sunburst только когда конкретной правке нужен более точный контроль. Все цены и время генерации выше — из реального тестового прогона по живому каталогу 2026-09-18, а не из маркетинговых материалов.

Предыдущую подборку моделей платформы смотрите в статье 24 новые модели, добавленные ранее в этом месяце, а разбор прошлого месяца — в дайджесте Claude Opus 5 и Gemini 3.6 Flash. Если синтез речи для вас новая тема — наше сравнение лучших AI text-to-speech разбирает предыдущее поколение голосовых моделей, рядом с которым теперь встаёт эта партия.

новые модели ИИсинтез речиGemini 3.8 FlashGPT Image 2.5Wan 3.0

Комментарии

Функция комментариев скоро появится! Ждите обновлений.

Back to Blog