⚡ AI переходит от гонки моделей к инженерии агентов
Кажется, индустрия AI постепенно выходит из фазы «давайте сделаем модель ещё умнее» и входит в гораздо более интересную фазу — как заставить уже существующие модели эффективно работать вместе и выполнять реальные задачи.
Один из самых интересных сигналов последних суток — проект Faraday от Inherent. Это специализированный AI-агент для научных исследований, построенный вокруг относительно небольшой модели. При этом Faraday может использовать более мощный coding agent как инструмент: одна модель решает, что делать дальше, другая непосредственно выполняет работу.
Получается новая архитектура:
Planner → Executor → Result → Evaluation → Planner
И это важный сдвиг. Возможно, будущее AI — не в одном гигантском агенте, который пытается делать всё, а в системе из специализированных компонентов, где каждый отвечает за свою часть работы.
Параллельно становится всё очевиднее другая проблема — контроль автономных агентов.
Когда AI получает доступ к файловой системе, GitHub, терминалу, API, браузеру и внешним сервисам, ошибка уже не заканчивается неправильным текстом. Агент может изменить код, отправить запрос, создать ресурс или запустить процесс.
Поэтому обычного:
> «Не делай ничего опасного»
в system prompt уже недостаточно.
Нужна реальная архитектура:
Agent → Policy → Permissions → Tools → Sandbox → Audit → Verification
Причём права должны быть ограничены по умолчанию.
Читать файлы — можно.
Запустить тесты — можно.
Изменить локальный код — можно.
Сделать git push — запросить подтверждение.
Доступиться до production secrets — запретить.
Ещё один интересный тренд — skills management. Появляются инструменты вроде skills-manager, которые пытаются решить новую проблему: у разработчика уже не один AI-агент, а Claude Code, Codex, Cursor, Copilot, Gemini CLI и другие. И каждому нужно передавать одинаковые инструкции, правила проекта и навыки.
Получается новый слой конфигурации:
Code → Agent → Skills → Tools → Permissions
И довольно скоро управление этими слоями может стать такой же обычной частью разработки, как package.json или CI/CD.
А GitHub продолжает показывать ещё более практичный путь. Вместо «суперагента, который самостоятельно перепишет весь проект», появляются маленькие фоновые workflow. Например, агент может каждый день найти одно безопасное улучшение в репозитории, проверить его и создать небольшой PR.
Это кажется скучным.
Но именно в этом и есть здравый смысл.
Чем меньше радиус действия агента, тем проще проверить результат. А значит, автономность можно наращивать постепенно:
наблюдать → анализировать → предлагать → делать маленькие изменения → получать больше прав.
Похоже, индустрия наконец начинает понимать простую вещь: надёжность агента не обязательно увеличивается вместе с количеством выданных ему полномочий.
И здесь появляется новый рынок.
Не очередной генератор кода, а инструменты, которые отвечают на вопросы:
Что именно сделал агент?
Почему он это сделал?
Какие файлы изменились?
Не вышел ли он за пределы задачи?
Можно ли доверять этому diff?
Сколько стоил запуск?
Какие права использовал агент?
Что произойдёт, если он ошибётся?
То есть следующий большой слой AI-разработки может выглядеть так:
Model → Agent → Orchestration → Permissions → Observability → Verification
🛠 Что можно попробовать: взять свой GitHub-репозиторий и запустить простой read-only аудит. Пусть агент сравнит README, package.json, .env.example, конфигурацию агентов и реальную структуру проекта. Не исправляет ничего — только ищет противоречия и показывает доказательства. Это отличный способ увидеть, сколько «дрейфа контекста» уже накопилось в обычном AI-generated проекте.
💭 Мысль: возможно, следующий этап AI — это не создание всё более автономных агентов. А создание среды, в которой автономным агентам наконец можно доверять.
#AI #AIEngineering #Agents #AgentOps #GitHub #DevTools #OpenSource #VibeCoding #Automation #LLM
Кажется, индустрия AI постепенно выходит из фазы «давайте сделаем модель ещё умнее» и входит в гораздо более интересную фазу — как заставить уже существующие модели эффективно работать вместе и выполнять реальные задачи.
Один из самых интересных сигналов последних суток — проект Faraday от Inherent. Это специализированный AI-агент для научных исследований, построенный вокруг относительно небольшой модели. При этом Faraday может использовать более мощный coding agent как инструмент: одна модель решает, что делать дальше, другая непосредственно выполняет работу.
Получается новая архитектура:
Planner → Executor → Result → Evaluation → Planner
И это важный сдвиг. Возможно, будущее AI — не в одном гигантском агенте, который пытается делать всё, а в системе из специализированных компонентов, где каждый отвечает за свою часть работы.
Параллельно становится всё очевиднее другая проблема — контроль автономных агентов.
Когда AI получает доступ к файловой системе, GitHub, терминалу, API, браузеру и внешним сервисам, ошибка уже не заканчивается неправильным текстом. Агент может изменить код, отправить запрос, создать ресурс или запустить процесс.
Поэтому обычного:
> «Не делай ничего опасного»
в system prompt уже недостаточно.
Нужна реальная архитектура:
Agent → Policy → Permissions → Tools → Sandbox → Audit → Verification
Причём права должны быть ограничены по умолчанию.
Читать файлы — можно.
Запустить тесты — можно.
Изменить локальный код — можно.
Сделать git push — запросить подтверждение.
Доступиться до production secrets — запретить.
Ещё один интересный тренд — skills management. Появляются инструменты вроде skills-manager, которые пытаются решить новую проблему: у разработчика уже не один AI-агент, а Claude Code, Codex, Cursor, Copilot, Gemini CLI и другие. И каждому нужно передавать одинаковые инструкции, правила проекта и навыки.
Получается новый слой конфигурации:
Code → Agent → Skills → Tools → Permissions
И довольно скоро управление этими слоями может стать такой же обычной частью разработки, как package.json или CI/CD.
А GitHub продолжает показывать ещё более практичный путь. Вместо «суперагента, который самостоятельно перепишет весь проект», появляются маленькие фоновые workflow. Например, агент может каждый день найти одно безопасное улучшение в репозитории, проверить его и создать небольшой PR.
Это кажется скучным.
Но именно в этом и есть здравый смысл.
Чем меньше радиус действия агента, тем проще проверить результат. А значит, автономность можно наращивать постепенно:
наблюдать → анализировать → предлагать → делать маленькие изменения → получать больше прав.
Похоже, индустрия наконец начинает понимать простую вещь: надёжность агента не обязательно увеличивается вместе с количеством выданных ему полномочий.
И здесь появляется новый рынок.
Не очередной генератор кода, а инструменты, которые отвечают на вопросы:
Что именно сделал агент?
Почему он это сделал?
Какие файлы изменились?
Не вышел ли он за пределы задачи?
Можно ли доверять этому diff?
Сколько стоил запуск?
Какие права использовал агент?
Что произойдёт, если он ошибётся?
То есть следующий большой слой AI-разработки может выглядеть так:
Model → Agent → Orchestration → Permissions → Observability → Verification
🛠 Что можно попробовать: взять свой GitHub-репозиторий и запустить простой read-only аудит. Пусть агент сравнит README, package.json, .env.example, конфигурацию агентов и реальную структуру проекта. Не исправляет ничего — только ищет противоречия и показывает доказательства. Это отличный способ увидеть, сколько «дрейфа контекста» уже накопилось в обычном AI-generated проекте.
💭 Мысль: возможно, следующий этап AI — это не создание всё более автономных агентов. А создание среды, в которой автономным агентам наконец можно доверять.
#AI #AIEngineering #Agents #AgentOps #GitHub #DevTools #OpenSource #VibeCoding #Automation #LLM