Логотип Data Secrets
LAB

Gemini 2.5 Flash TTS

Последняя модель для кодинга от Google

Аудио

Содержание

О модели#

Gemini 2.5 Flash TTS превращает текст в аудио сразу в HTTP-ответе. Модель подходит для голосовых ассистентов, озвучки уведомлений, прототипов voice UI и короткого динамического контента, где важна низкая задержка.

Характеристики#

Параметр

Значение

Контекстное окно

8K токенов

Максимальная длина вывода

8K токенов

Мультимодальность

Текст в речь

Дата выхода

10 декабря 2025

Возможности#

Сценарий

Как использовать

озвучка ответов чат-ботов и ассистентов

Подходит для production и прототипов

voice UI, подсказки в приложениях и учебные сценарии

Подходит для production и прототипов

быстрая генерация WAV/MP3 без отдельной очереди задач

Подходит для production и прототипов

Что важно знать#

Это sync endpoint: результат приходит бинарным аудио, а не JSON.

Сохраняйте тело ответа в файл с расширением, соответствующим response_format.

Длинные тексты лучше разбивать на фрагменты, чтобы контролировать задержку и стоимость.

Стоимость#

Что тарифицируется

Цена

Синтез речи за 1 символ

0.0022 руб

Оплата списывается с баланса DS Lab в DS-коинах. 1 DS-коин = 1 ₽.

API#

1. Создайте API-ключ на странице dslab.tech/api/keys

2. Используйте https://api.dslab.tech/v1 как base_url в SDK или прямых HTTP-запросах. Модель: gemini-2.5-flash-tts.

3. Для OpenAI-compatible SDK смотрите platform.openai.com/docs/libraries

WAV файл
curl https://api.dslab.tech/v1/audio/speech \
  -H "Authorization: Bearer $DSLAB_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "gemini-2.5-flash-tts", "input": "Привет, это короткая проверка синтеза речи.", "voice": "alloy", "response_format": "wav"}' \
  --output speech.wav

Эндпоинт#

Синтезирует речь и возвращает аудиофайл в том же HTTP-ответе.

POST https://api.dslab.tech/v1/audio/speech

Поле

Значение

Authorization

Bearer $DSLAB_API_KEY

Content-Type

application/json

Model

gemini-2.5-flash-tts

Режим

sync

Параметры#

Параметр

Тип

По умолчанию

Описание

model

string

-

Точный slug модели

input

string

-

Текст для озвучки

voice

string

alloy

Голос

response_format

string

wav

Формат аудио: wav или mp3

Еще модели от этого провайдера

Все