🛠 Эра бенчмарков всё. Наступает эпоха скучной инженерной гигиены в AI
Последние дни на AI-рынке очень четко очертили тектонический сдвиг: индустрия наконец-то наигралась в замеры «у кого модель на 2% умнее» и уперлась в суровую реальность продакшена.
Когда агент может не просто писать текст, а трогать файлы, запускать скрипты, дергать внешние API и коммитить код, ошибка перестает быть «забавной галлюцинацией» и становится реальным инцидентом.
Три мысли, которые сейчас определяют зрелую AI-разработку:
• 🔹 Монолитные чаты умирают — рулит Model Routing
• 🔹 Выбирать модель вручную в интерфейсе — это как вручную выбирать ядро процессора для открытия вкладки в браузере. Архитектура здорового человека:
• 🔹 Request → Classifier → Router (Fast / Cheap / Heavy Reasoning / Local) → Result.
• 🔹 Глупо и дорого гонять топ-модели на форматирование JSON, когда для этого есть легковесные решения, а тяжелую артиллерию стоит звать только на сложный reasoning и независимый арбитраж.
• 🔹 Главная боль AI-разработки — Context & Docs Drift
• 🔹 Когда нейросети генерируют код со скоростью пулемета, документация, схемы и конфиги устаревают не за недели, а за пару часов. Код говорит одно, .env.example — другое, README — третье, а в проде вообще четвертое.
• 🔹 Будущее здесь не за одним «всемогущим суперагентом», а за узкими фоновыми аудиторами (нотариусами), которые каждую ночь молча сверяют источники правды и выдают четкий диф.
• 🔹 DAG и жесткие контрольные точки вместо «сделай всё сам»
• 🔹 Если скормить сложную задачу одной модели одной портянкой — она сломается. Если разбить процесс на детерминированный граф с валидацией каждого шага (Code → Test → Fail? → Diagnose → Retry), надежность вырастает в разы без смены самой модели.
Резюме: Самая большая ценность сейчас строится не вокруг создания еще одной LLM, а на слое после генерации: верификация, мониторинг прав доступа, умная маршрутизация и аудит.
Писать код стало элементарно. Держать систему в непротиворечивом состоянии — вот настоящий вызов.
#AI #Engineering #LLM #Development
Последние дни на AI-рынке очень четко очертили тектонический сдвиг: индустрия наконец-то наигралась в замеры «у кого модель на 2% умнее» и уперлась в суровую реальность продакшена.
Когда агент может не просто писать текст, а трогать файлы, запускать скрипты, дергать внешние API и коммитить код, ошибка перестает быть «забавной галлюцинацией» и становится реальным инцидентом.
Три мысли, которые сейчас определяют зрелую AI-разработку:
• 🔹 Монолитные чаты умирают — рулит Model Routing
• 🔹 Выбирать модель вручную в интерфейсе — это как вручную выбирать ядро процессора для открытия вкладки в браузере. Архитектура здорового человека:
• 🔹 Request → Classifier → Router (Fast / Cheap / Heavy Reasoning / Local) → Result.
• 🔹 Глупо и дорого гонять топ-модели на форматирование JSON, когда для этого есть легковесные решения, а тяжелую артиллерию стоит звать только на сложный reasoning и независимый арбитраж.
• 🔹 Главная боль AI-разработки — Context & Docs Drift
• 🔹 Когда нейросети генерируют код со скоростью пулемета, документация, схемы и конфиги устаревают не за недели, а за пару часов. Код говорит одно, .env.example — другое, README — третье, а в проде вообще четвертое.
• 🔹 Будущее здесь не за одним «всемогущим суперагентом», а за узкими фоновыми аудиторами (нотариусами), которые каждую ночь молча сверяют источники правды и выдают четкий диф.
• 🔹 DAG и жесткие контрольные точки вместо «сделай всё сам»
• 🔹 Если скормить сложную задачу одной модели одной портянкой — она сломается. Если разбить процесс на детерминированный граф с валидацией каждого шага (Code → Test → Fail? → Diagnose → Retry), надежность вырастает в разы без смены самой модели.
Резюме: Самая большая ценность сейчас строится не вокруг создания еще одной LLM, а на слое после генерации: верификация, мониторинг прав доступа, умная маршрутизация и аудит.
Писать код стало элементарно. Держать систему в непротиворечивом состоянии — вот настоящий вызов.
#AI #Engineering #LLM #Development