Модели понимания видео TwelveLabs теперь доступны в Amazon Bedrock
AWS добавляет в Amazon Bedrock нативные модели видеоэмбеддингов и понимания видео. Это открывает массу потенциальных сценариев, для которых я раньше тянулся к моделям Gemini. Один из примеров — обучающая система, которая наблюдает, как ученик выполняет задание, и даёт обратную связь на основе учебных материалов.
В Bedrock и раньше были workflow для понимания видео, но это были именно workflow, без нативных моделей. Можете представить, как они выглядели: берём видео, режем на кадры, скармливаем кадры VLM, пытаемся сохранить временную согласованность, отчаиваемся, смиряемся с производительностью системы и уезжаем в отпуск.
Теперь же нативных видеомоделей сразу две:
- TwelveLabs Marengo — для создания видеоэмбеддингов;
- TwelveLabs Pegasus — для генерации текста на основе видео.
Цены зависят от того, есть ли у видео аудиодорожка, но ориентируйтесь на $2.5–$3 за час видео для Marengo и $1.8 за час для Pegasus.