-m, --model <MODEL> | TTS model to use | qwen3-tts-0.6b-base |
-s, --speaker <VOICE> | Built-in voice/speaker ID, or VibeVoice speaker label | model default |
--saved-voice-id <ID> | Reuse a saved reference voice from /v1/voices | — |
--reference-audio <PATH> | Reference audio file for voice cloning | — |
--reference-text <TEXT> | Transcript for the reference audio | — |
--reference-text-file <PATH> | File containing the reference transcript | — |
--instructions <TEXT> | Voice direction prompt for voice-design models | — |
-o, --output <PATH> | Output file path | stdout |
-f, --format <FORMAT> | Audio format requested from the server. OSS native output is wav; compressed choices require server-side encoder support. | wav |
-r, --speed <SPEED> | Speech speed (0.5-2.0) | 1.0 |
-t, --temperature <TEMP> | Sampling temperature | 0.7 |
--stream | Stream output in real-time | — |
--allow-format-fallback | Allow WAV output when a requested compressed format is unavailable | — |
-p, --play | Request playback after generation. The current CLI saves audio and reports playback as not implemented. | — |