Модели понимания видео TwelveLabs теперь доступны в Amazon Bedrock

AWS добавляет в Amazon Bedrock нативные модели видеоэмбеддингов и понимания видео. Это открывает массу потенциальных сценариев, для которых я раньше тянулся к моделям Gemini. Один из примеров — обучающая система, которая наблюдает, как ученик выполняет задание, и даёт обратную связь на основе учебных материалов.

В Bedrock и раньше были workflow для понимания видео, но это были именно workflow, без нативных моделей. Можете представить, как они выглядели: берём видео, режем на кадры, скармливаем кадры VLM, пытаемся сохранить временную согласованность, отчаиваемся, смиряемся с производительностью системы и уезжаем в отпуск.

Теперь же нативных видеомоделей сразу две:

  1. TwelveLabs Marengo — для создания видеоэмбеддингов;
  2. TwelveLabs Pegasus — для генерации текста на основе видео.

Цены зависят от того, есть ли у видео аудиодорожка, но ориентируйтесь на $2.5–$3 за час видео для Marengo и $1.8 за час для Pegasus.