Mesh Refinement

Константин Мещеряков. Head of AI в IoT-сфере, кандидат физико-математических наук, шестнадцать лет инженерной работы: встраиваемые системы, машинное обучение, AWS. По работе выстраиваю GenAI-стратегию, веду программы внедрения AI для инженеров и отвечаю за соответствие требованиям EU AI Act. Здесь я пишу об AI-системах на практике: агенты и LLM-архитектуры, разработка с AI-ассистентами, регулирование и edge AI. Пишу с ясной позицией, с опорой на практику и без хайпа.

Сначала почистите документы

В последнее время появляется множество предупреждений об уязвимостях, связанных с непрямыми атаками через prompt injection. Главный вывод: LLM легковерны, и никто не знает, как сделать их полностью устойчивыми. Следовательно, ни одна ИИ-система не безопасна.

Это, конечно, чистая правда, и внимание, которое привлекают такие атаки, можно только приветствовать, но главный вопрос остаётся без ответа: что со всем этим делать?

Пуристы потребовали бы запретить любой внешний ввод, способный привести к prompt injection, но, честно говоря, я бы не был столь категоричен. Множество по-настоящему полезных приложений опирается на внешний ввод, так что, боюсь, нам придётся отступить к последнему рубежу: инженерной дисциплине.

Существуют разные схемы, где хитрое взаимодействие нескольких моделей минимизирует их уязвимость к атакам (см., например, статью о CaMeL). Мне, однако, кажется, что мы уделяем недостаточно внимания простой санитизации входных данных.

Многие такие атаки полагаются на текст, скрытый от человека, но видимый машине. Обнаружить и удалить такой текст относительно тривиально (в программистском смысле), хотя работать придётся уже на уровне контейнера, за пределами самого текста. Эта техника (называемая, кстати, Content Disarm & Reconstruction) существует уже довольно давно. Честно говоря, я удивлён, что она не внедрена повсеместно. Все атаки она не предотвратит, но жизнь неискушённому атакующему заметно усложнит.

А тем, кто настаивает, что 99% в безопасности — это незачёт, хочу напомнить фундаментальный принцип: стопроцентно защищённых систем не бывает. Роль безопасности в том, чтобы сделать атаку дороже потенциальной выгоды от неё (см. модель Гордона — Лоэба).

С этой парадигмой в голове мы можем строить надёжные и безопасные ИИ-системы даже из небезопасных по отдельности компонентов.

Кое-что из того, что нужно знать о свежем релизе GPT-5 и о чём молчат евангелисты:

  1. GPT-5 не является одной моделью. То, что называют GPT-5 вне контекста API, — это роутер, который отправляет ваш запрос той модели, которая, по его мнению, справится с ним эффективнее всего. Обещание OpenAI дать доступ каждому нужно рассматривать именно в этом свете. Доступ дают к роутеру, и вы не знаете, какую конфигурацию он применяет к вам и удастся ли вам вообще протестировать самую мощную модель. Это неизбежно приводит к совершенно разному опыту у разных пользователей.

  2. GPT-5 не является PhD. Это довольно способная модель (по крайней мере, одна из), которая блистает в некоторых задачах. Улучшений можно ожидать в:

    • способностях к кодингу (по некоторым вайб-тестам они впечатляют, но по бенчмарку SWE-bench Verified отрыв от Claude Opus 4.1 совсем небольшой);
    • вызове инструментов — а это самое важное для агентных нагрузок;
    • других задачах, где у OpenAI был доступ к немедленной обратной связи.

    Для многих областей это важные улучшения, но уровня PhD они модели не дают. Галлюцинация про профиль крыла во время демо отлично показывает, что модель по-прежнему усваивает самое распространённое мнение, а не самое актуальное. Это очень трудная проблема, и на пути к AGI она остаётся одним из главных препятствий.

  3. Снижение числа галлюцинаций — палка о двух концах. С одной стороны, чем меньше модель галлюцинирует, тем лучше: ей можно больше доверять. С другой стороны, чем больше вы доверяете модели, тем выше шанс пропустить настоящие галлюцинации. В реальном мире лучше всех модель, которая не галлюцинирует никогда. Модель, галлюцинирующая в 0.01% случаев, может оказаться опаснее той, что галлюцинирует в 10%.

Моё личное впечатление пока такое: у неё та же проблема, что и у предыдущих моделей OpenAI, — без аккуратного промптинга она крайне поверхностна. Она выдаёт самый неглубокий анализ, какой только сойдёт ей с рук, и маскирует это очень хорошо структурированными ответами.

Google Opal

Google Opal

Google запустила публичное превью своего нового инструмента для графического создания многошаговых ИИ-процессов. Для продакшена он явно не предназначен, зато отлично помогает собирать персональные инструменты (а персональные инструменты стоит делать каждому, правда — сейчас это главный дифференциатор).

Он работает на платформе Gemini с моделями Gemini (ну разумеется) и, будучи превью-инструментом, пока бесплатен. В будущем он, скорее всего, станет использовать план Gemini, если тот есть у пользователя. Насчёт собственных API-ключей не уверен: это выглядит как инструмент для широкой публики, но посмотрим.

Пока он доступен только в США.

X гудит о новой модели Horizon Alpha, которая в одиночку бьёт все предыдущие модели на разнообразных вайб-тестах (читай: единороги на велосипедах и тому подобное). У модели контекстное окно 256k — солидная, хотя и не самая впечатляющая цифра.

Скорее всего, это новая модель OpenAI (GPT-5?): подобный трюк они уже проделывали. Попробовать её можно на openrouter.ai совершенно бесплатно, только помните, что приватные данные ей передавать не стоит — они собираются и используются для улучшения модели.

Сабагенты Claude Code

Anthropic добавила в Claude Code возможность создавать и использовать специализированных сабагентов. Сабагенты работают в отдельном контекстном окне, что позволяет выполнять отдельные задачи, не засоряя основной контекст и ограничивая эффект context rot. Созданных сабагентов можно запускать вручную или доверить Claude Code самому решать, когда их использовать.

Что может стать хорошим сабагентом? Всё, что должно быть экспертом в своей области, не нуждается в общем контексте с основным агентом, может иметь выделенные инструменты и рассчитано на самодостаточные задачи. Чтобы дать представление о том, что можно превратить в сабагента, вот пара примеров:

  1. Git-сабагент, на которого можно свалить разнообразные операции с git. Поскольку ему хватает локального состояния git и доступ к глобальному контексту ему ни к чему, он отлично подходит на роль инструмента с собственным контекстным окном.
  2. Сабагент — писатель книг (знаю-знаю, но я создаю книгоподобные документы в определённом стиле для самообразования). Вы даёте ему высокоуровневый план, набор материалов и одну-две секции в качестве примеров, а дальше он работает над секцией отдельно от других сабагентов.

Второму примеру очень пригодилась бы возможность запускать несколько сабагентов параллельно, но, похоже, я хочу слишком многого.

Цитируя Арвинда Нараянана:

Если бы мы сравнивали возможности ИИ с людьми, лишёнными доступа к инструментам вроде интернета, то, вероятно, обнаружили бы, что ИИ уже превосходит человека во многих или даже в большинстве когнитивных задач, которые мы выполняем на работе. Но, конечно, такое сравнение мало чем полезно и мало говорит об экономических эффектах ИИ. Без наших инструментов мы ничто.

Модели понимания видео TwelveLabs теперь доступны в Amazon Bedrock

AWS добавляет в Amazon Bedrock нативные модели видеоэмбеддингов и понимания видео. Это открывает массу потенциальных сценариев, для которых я раньше тянулся к моделям Gemini. Один из примеров — обучающая система, которая наблюдает, как ученик выполняет задание, и даёт обратную связь на основе учебных материалов.

В Bedrock и раньше были workflow для понимания видео, но это были именно workflow, без нативных моделей. Можете представить, как они выглядели: берём видео, режем на кадры, скармливаем кадры VLM, пытаемся сохранить временную согласованность, отчаиваемся, смиряемся с производительностью системы и уезжаем в отпуск.

Теперь же нативных видеомоделей сразу две:

  1. TwelveLabs Marengo — для создания видеоэмбеддингов;
  2. TwelveLabs Pegasus — для генерации текста на основе видео.

Цены зависят от того, есть ли у видео аудиодорожка, но ориентируйтесь на $2.5–$3 за час видео для Marengo и $1.8 за час для Pegasus.

Одна из форм деградации контекста (context rot) — то, что я называю самоподкрепляющейся структурой. Принимая длинный ответ модели, вы сигнализируете, что такая структура приемлема, и она старается генерировать последующие ответы в похожем виде. Для любой длинной творческой работы это может оказаться разрушительным.

Единственная настоящая защита — следить, чтобы история, которую получает модель, таких ответов не содержала. То есть либо пресекать их появление на ранней стадии, либо чинить позже, передавая вместо реальной истории краткое резюме предыдущего разговора.

Представляем агента ChatGPT: мост между исследованием и действием

OpenAI выпустила агента, который может управлять вашим собственным компьютером. Он использует свои продвинутые способности к рассуждению, чтобы планировать и решать задачи в приложениях вроде Excel и PowerPoint.

Пока Сэм Альтман «чувствует AGI», глядя на работу системы, мне она кажется невероятно неуклюжей. Вместо того чтобы сосредоточиться на нативных инструментах для моделей (MCP — хороший шаг вперёд, пусть и не без проблем), им пытаются эмулировать руки и глаза, чтобы модели могли делать то же, что и мы, только медленно и коряво.

Так что я считал бы этот тип агентов временным обходным решением, пока мы не разработаем более совершенные механизмы межмашинного взаимодействия. После этого они будут обслуживать всё более длинный хвост легаси-систем, у которых таких машинных интерфейсов уже не появится.

P.S. Gemini подсказал точку зрения, которую я не учёл: подобные системы могут собирать данные, необходимые для обучения более качественного воплощённого интеллекта, то есть способного действовать в реальном мире. Совершенно справедливое замечание, которое не стоит оставлять без внимания.

Отчёт Stanford AI Index 2025

Стэнфорд опубликовал свой ежегодный отчёт. Он довольно важен, потому что отделяет спекуляции от голых цифр. Наряду с очевидными вещами (ИИ становится лучше, дешевле и распространённее — кто бы мог подумать) там есть весьма интересные факты:

  1. Хотя ИИ сейчас используют почти все организации (78% в 2024-м, хотя для большинства это, без сомнения, сводится к сочинению писем чат-ботами), реальные результаты довольно скромны. Рост продуктивности составляет порядка 10% (честно говоря, такой прирост за один год в некотором смысле беспрецедентен), но рост выручки в большинстве отраслей — лишь около 5%. Почему? Потому что, как и с любой технологией общего назначения, полная реализация выгоды потребует полной перестройки организационных структур и процессов. Проблема в том, что никто не знает, как эти новые процессы должны выглядеть, и учиться придётся на собственных ошибках.

  2. Возможно, уже не новость, но ИИ даёт больше рычага менее опытным сотрудникам. Великий уравнитель современности. Опять же, это значит, что подход к комплектованию команд придётся переосмыслить. Добавлю лишь, что помочь он способен, только если вы хотя бы отдалённо понимаете, что делаете, так что претендентам на начальные позиции стоит хорошо готовиться.

  3. Число инцидентов, связанных с ИИ, продолжает расти. В 2024-м мы видим двукратный рост по сравнению с 2023-м, и это ещё до лихорадочного внедрения агентов и MCP, которое мы наблюдаем в 2025-м. Так что стоит собраться с духом и приготовиться к новым и новым утечкам данных и нарушениям целостности.

В отчёте ещё много ценного, но в нём почти 500 страниц, так что искренне рекомендую использовать ИИ, чтобы вытащить оттуда то, что вам интересно.