Synopsis
Description
Aligns reference text to audio, producing word-level timestamps. Useful for:- Subtitle generation
- Karaoke timing
- Audio editing
- Pronunciation analysis
Arguments
Options
Examples
Basic alignment
Save to file
Text output
Output Formats
JSON (default)
Text
Use Cases
Subtitle Generation
Generate precise timestamps for subtitles:Audio Editing
Find exact word boundaries for editing:Pronunciation Analysis
Analyze timing of spoken words:Available Models
See Also
izwi transcribe— Speech-to-textizwi diarize— Speaker diarization