Voxtral

Mistral представляет Voxtral — семейство open source моделей для распознавания и понимания речи. Давно пора. Сопоставимой открытой модели мы не видели со времён Whisper от OpenAI, а это было довольно давно.

Модели выпускаются в размерах 3B и 24B и превосходят Whisper на большинстве бенчмарков. Однако им требуется более мощное железо: самый крупный вариант Whisper — всего 1.5B. Это прямое следствие того, что Voxtral одновременно является обычной языковой моделью. Другое следствие: управлять такими моделями в режиме чистой транскрипции будет сложнее.

Модели доступны на Hugging Face, а также через API Mistral и их LeChat.

Чего им пока не хватает, так это поддержки диаризации (распознавания говорящих). Она заявлена в роадмапе, а тем временем для этой цели приходится использовать несколько неуклюжий pyannote-audio.

Стратегический интеллект в больших языковых моделях: данные эволюционной теории игр

Статья показывает, что разные модели ведут себя совершенно по-разному, когда их помещают в теоретико-игровые условия. Из этого следует, что тестирование и evals играют всё более критичную роль в разработке агентных систем: обновление или смена базовой модели приведёт к непредсказуемым изменениям в поведении агента.

Представляем Kiro

AWS запрыгивает в вагон агентных IDE со своим Kiro. Чтобы отстроиться от вайб-кодинга, успевшего накопить изрядно дурной славы, они делают упор на метод «spec-driven development». Это значит, что агент сначала помогает пользователю составить полный документ с требованиями к фиче, затем анализирует существующую кодовую базу и только после этого приступает к реализации.

Подход определённо осмысленный, и это шаг вперёд по сравнению со слепым бросанием в бой, каким является вайб-кодинг. То, что спеки обновляются вместе с изменениями кода, делает их ещё ценнее и сводит к минимуму проблему устаревшей документации. Хуки позволяют автоматически выполнять повторяющиеся агентные задачи — например, проверять, что новая фича достаточно покрыта тестами.

Интересно наблюдать, как разные инструменты берут на вооружение разные методологии: это позволяет сообществу разработчиков находить и распространять техники, которые действительно работают.

TIL: ccusage — приятный инструмент для отслеживания и анализа использования Claude Code.

Anthropic выпустила 4 новых курса в своей академии:

  1. Claude Code in Action с практическими советами по использованию CLI-агента.
  2. Claude with the Anthropic API — исчерпывающий курс по всем текущим возможностям API, от одиночной генерации текста до агентов.
  3. Introduction to Model Context Protocol и Model Context Protocol: Advanced Topics для тех, кому интересен MCP.

Каждый курс доступен в видео- и текстовом форматах и даёт сертификат о прохождении.

TIL: DBML — Database Markup Language

Язык разметки для описания схемы БД, который может пригодиться для передачи её ИИ-инструментам.

Парадокс продуктивности ИИ

Исследование показывает, что современные ИИ-агенты могут реально замедлять опытных разработчиков примерно на 19%.

Очень важно понимать: ИИ-модели недетерминированы, и сделать их детерминированными без жёсткого ограничения среды выполнения невозможно. Фиксация сидов не помогает. Нулевая температура не помогает. Любая крошечная ошибка округления с плавающей точкой может в итоге привести к кардинально другим результатам.

Сложные модели по своей сути являются хаотическими системами, и обращаться с ними следует соответственно.

ИИ-агенты для кодинга — просто ещё один инструмент в арсенале хорошего разработчика. Он начинает с каменной глыбы и использует агентов как метафорическую кувалду, чтобы придать ей задуманную грубую форму. Затем он берётся за инструменты ИИ-ассистированного кодинга вроде GitHub Copilot, чтобы работать точнее, — это уже молоток поменьше. И наконец, самым маленьким резцом он вручную вытачивает тончайшие детали.

Забавно слышать, что искусство программирования умерло, потому что мы больше не обтёсываем глыбы одними лишь маленькими резцами.

Забавная штука: Gemini Deep Research программно отучен заканчивать работу раньше времени. Я обнаружил это, когда попытался с его помощью извлечь информацию из неструктурированного текста и заполнить шаблон. Хотя это исследовательский инструмент, у него есть всё необходимое для такой задачи: доступ к Google Docs, умение создавать длинные документы и дотошный агентный процесс. Разумеется, если мы хотим просто переструктурировать документ, важно, чтобы модель вообще не пользовалась поиском в интернете.

Агент справился с работой вполне хорошо и быстро. Однако когда он уже собирался закончить, программный оркестратор несколько раз подстегнул его командой «продолжай исследование» — и угадайте что? Он полез в интернет искать недостающую информацию.

Мораль: с такими системами можно проявлять изобретательность, но будьте готовы к тому, что обвязка вставит вам палки в колёса.