Description
Multimodal video-to-summary pipeline: turns a raw video (upload, public URL, meeting recording) into a structured hierarchical summary — executive TL;DR plus timestamped chapters — combining speech transcription and vision scene analysis.
