This is a simple server that uses Silero models to convert text to audio files over HTTP
2.4K
All models are from the repository: snakers4/silero-models
| Language | Model | Speakers |
|---|---|---|
| Russian | v4_ru | 5: aidar, baya, kseniya, xenia, eugene |
| Ukrainian | v4_ua | 1: mykyta |
| Uzbek | v4_uz | 1: dilnavoz |
| English | v3_en | 118: en_0, en_1, ..., en_117 |
| Spanish | v3_es | 3: es_0, es_1, es_2 |
| French | v3_fr | 6: fr_0, fr_1, fr_2, fr_3, fr_4, fr_5 |
| German | v3_de | 5: bernd_ungerer, eva_k, friedrich, hokuspokus, karlsson |
| Tatar | v3_tt | 1: dilyara |
| Mongolian | v3_xal | 2: erdni, delghir |
docker run --rm -p 8000:8000 twirapp/silero-tts-api-server
version: '3'
services:
silero-tts-api-server:
image: twirapp/silero-tts-api-server
ports:
- "8000:8000"
environment:
- TEXT_LENGTH_LIMIT=930
- MKL_NUM_THREADS=8
You can view the automatically generated documentation based on OpenAPI at:
GET /generate - Generate audio in wav format from text. Parameters: text speaker sample_rate, pitch, rateGET /speakers - Get list of speakerssample_rate can be set from 8 000, 24 000, 48 000
pitch and rate can be set from 0 to 100
TEXT_LENGTH_LIMIT - Maximum length of the text to be processed. Default is 930 characters.MKL_NUM_THREADS - Number of threads to use for generating audio. Default number of threads: number of CPU cores.This repository is dedicated to twir.app and is designed to meet its requirements.
TwirApp needs to generate audio using the CPU. If support for other devices such as cuda or mps is needed, please open an issue.
Content type
Image
Digest
sha256:99bad1a53…
Size
614.5 MB
Last updated
over 2 years ago
docker pull twirapp/silero-tts-api-server