WEBVTT

NOTE Metadata track — cue payloads are JSON, not display text.

00:00:01.000 --> 00:00:03.000
{"event":"scene-change","confidence":0.94}

00:00:05.000 --> 00:00:07.000
{"event":"face-detected","count":2,"boxes":[[10,20,80,90],[120,30,60,70]]}

00:00:09.000 --> 00:00:11.000
{"event":"speech","speaker":"A","words":12}
