Преобразова­ние аудио в текст

API • Распознавание речи

Превращайте аудио в готовый текст: загружайте запись, запускайте расшифровку и смотрите результат. Подходит для интервью, встреч, лекций, подкастов и любых других записей.

Gemma 4
Kimi
MiniMax AI
OpenAI
Nemotron
Qwen
Z.ai
Gemma 4
Kimi
MiniMax AI
OpenAI
Nemotron
Qwen
Z.ai

Аутентификация

Все запросы требуют заголовок «Authorization» с вашим
API-ключом- ключ доступен в личном кабинете:

Authorization: Bearer <ваш_api_ключ>
  • Получите API-ключ
  • Управляйте подпиской
  • Следите за лимитами

Эндпоинт

Преобразует речь в текст на исходном языке.

api/v1/audio/transcriptions

Параметры запроса

Тип содержимого: multipart/form-data

file*
Аудиофайл
Форматы:mp3, wav, flac, ogg, opus
Максимум 25 МБ
model*
Аудиофайл
gigaam— рекомендуется для русской речи
whisper-large— для любого языка
response_format
Формат ответа
По умолчаниюjson
Доступно:json, text, srt, vtt, verbose_json
language
Язык аудио
формат ISO-639-1 (например, ru, en)

* - обязательный параметр

Тарификация

10 кредитов за секунду аудио. Округление вверх до целой секунды.

01
Аудио длится
47,3 секунды
Сервис считывает длительность исходного аудиофайла в секундах — с округлением вниз до десятых.
02
Округление до
48 секунды
Длительность округляется вверх до целой секунды — тарифицируем только полные интервалы.
03
Спишется
480 кредитов
Каждая секунда аудио стоит 10 кредитов: 48 × 10 = 480 кредитов за расшифровку.

Примеры интеграции

Python — OpenAI SDK

from openai import OpenAI

client = OpenAI(
    api_key="ваш_api_ключ",
    base_url="https://ai.wormsoft.ru/api/v1",
)

with open("audio.mp3", "rb") as f:
    transcription = client.audio.transcriptions.create(
        model="gigaam",
        file=f,
        language="ru",
        response_format="text",
    )

print(transcription)

cURL

curl https://ai.wormsoft.ru/api/v1/audio/transcriptions \
  -H "Authorization: Bearer ваш_api_ключ" \
  -F "file=@audio.mp3" \
  -F "model=gigaam" \
  -F "language=ru" \
  -F "response_format=json"

Форматы ответа

json — по умолчанию

{ "text": "Привет, мир!" }

text

Привет, мир!

srt

1
00:00:00,000 --> 00:00:02,500
Привет, мир!

vtt

WEBVTT

00:00:00.000 --> 00:00:02.500
Привет, мир!

verbose_json

{
    "task": "transcribe",
    "language": "russian",
    "duration": 2.5,
    "text": "Привет, мир!", "segments": [
       {
           "id": 0,
           "start": 0.0,
           "end": 2.5,
           "text": "Привет, мир!",
           "tokens": [],
           "temperature": 0,
           "avg_logprob": 0,
           "compression_ratio": 1,
           "no_speech_prob": 0
       }
    ],
    "words": []
}

Ошибки

Все ошибки возвращаются в формате, совместимом с OpenAI:

{
    "error": {
        "message": "Missing required parameter: 'file'.",
        "type": "invalid_request_error",
        "param": "file",
        "code": null
    }
}
400
Некорректный запрос (отсутствует файл или параметры)
401
Неверный или отсутствующий API-ключ
402
Недостаточно кредитов для обработки файла
429
Превышен лимит подписки
500
Внутренняя ошибка сервера
503
Сервис транскрибации недоступен
504
Превышено время ожидания транскрибации
P.S.
API совместим с OpenAI Whisper.
Вы можете использовать официальный OpenAI SDK, заменив базовый URL на https://ai.wormsoft.ru/api/v1.

Если вы хотите, чтобы ваш агент (OpenClaw) настроил себе транскрибацию сам, то передайте ему файл с инструкциями по ссылке: transcribe.md.