Forced alignment — align text to audio at word level.

Synopsis


Description

Aligns reference text to audio, producing word-level timestamps. Useful for:
  • Subtitle generation
  • Karaoke timing
  • Audio editing
  • Pronunciation analysis

Arguments


Options


Examples

Basic alignment

Save to file

Text output


Output Formats

JSON (default)

Text


Use Cases

Subtitle Generation

Generate precise timestamps for subtitles:

Audio Editing

Find exact word boundaries for editing:

Pronunciation Analysis

Analyze timing of spoken words:

Available Models


See Also