Or jump from this list on a smaller screen.

This is a page from the Audivra documentation. Developer exportsindex: http://127.0.0.1:3000/docs/llms.txt, full corpus: http://127.0.0.1:3000/docs/llms-full.txt, OpenAPI: http://127.0.0.1:3000/docs/openapi.json, Postman: http://127.0.0.1:3000/docs/postman.json. Press ⌘K to search docs.

Models

TTS, video, and local engines control quality, latency, VRAM footprint, language coverage, and plan tier gates.

Per-request text is capped at 5,000 characters across cloud API routes. Local fast-path engines use shorter limits — see Local worker.

Speech models

modelNameLatencyLanguagesMax textLicenseVRAMTier
kokoro-82mKokoro-82MUltra-fasten-US, sw-KE, ha-NG, yo-NG, am-ET, hi-IN, bn-IN, de-DE, it-IT, nl-NL, zu-ZA5,000Apache 2.0Low (T4)All plans
kokoroKokoroFasten-US, en-GB5,000Apache 2.0LowAll plans
f5-ttsF5-TTSStreamingen-US, Clone any language (Starter+)5,000MITMedAll plans
xtts-v2XTTS v2Cloneja-JP, 17+ clone languages5,000CoquiMedStarter+
cosyvoice-2CosyVoice 2Expressivefr-FR5,000Apache 2.0HighCreator Pro+

Video / lip-sync models

musetalk

MuseTalk · Video lip-sync

Moderate · Apache 2.0 · VRAM: Med

Languages: Language-agnostic (audio-driven)

Max text: 5,000 chars · Tier: All plans

latentsync

LatentSync · Fast lip-sync

Fast · Apache 2.0 · VRAM: Low

Languages: Language-agnostic (audio-driven)

Max text: 5,000 chars · Tier: All plans

liveportrait

LivePortrait · Photo expressions

Moderate · Research · VRAM: Med

Languages: Language-agnostic (audio-driven)

Max text: 5,000 chars · Tier: Starter+

sadtalker

SadTalker · Audio-driven portrait

Moderate · MIT · VRAM: Med

Languages: Language-agnostic (audio-driven)

Max text: 5,000 chars · Tier: All plans

emo

EMO · Expressive generation

Slow · Research · VRAM: High

Languages: Language-agnostic (audio-driven)

Max text: 5,000 chars · Tier: Creator Pro+

codeformer

CodeFormer · Face enhancement

Fast · Non-commercial · VRAM: Low

Languages: N/A (post-processing)

Max text: 5,000 chars · Tier: Starter+

Local / self-hosted

ollama-qwen

Ollama — Qwen2.5 3B · Fast local LLM

Local (<500 chars) · Apache 2.0 · ~2.5 GB

Languages: Multilingual

Max text: 500 chars · Tier: Self-hosted

ollama-llama

Ollama — Llama 3.2 3B · Fast local LLM

Local (<500 chars) · Llama 3.2 · ~2.5 GB

Languages: Multilingual

Max text: 500 chars · Tier: Self-hosted

piper-tts

Piper TTS · CPU-friendly TTS

Ultra-fast · MIT · CPU

Languages: en-US, Regional packs

Max text: 500 chars · Tier: Self-hosted

Self-hosted stack details: Local worker