Статья

Из модели — в работника: как ИИ-агента собирают под конкретную задачу

Из модели — в работника: как ИИ-агента собирают под конкретную задачу

ProfileProfile·4 ч назад·
4
··0·
13 августа 2026 года DeepSeek выложила в открытый доступ то, чего от неё ждали меньше всего, — не модель, а обвязку. DeepSeek Harness, developer preview под лицензией MIT, запускается одной командой через npx и превращает языковую модель в агента: он читает и правит файлы проекта, выполняет команды, ищет информацию, строит план и раздаёт работу субагентам. Репозиторий за считаные часы собрал десятки тысяч звёзд. Заодно компания довела до релиза флагманскую V4-Pro, заточенную под агентные нагрузки.
Интереснее самой платформы сдвиг, который она подсвечивает: ценность переехала из модели в то, что вокруг неё. Ниже — разбор: из чего агент состоит, чем конструктор отличается от голого API, во что обходятся десятки шагов и какие предохранители обязательны.

Что именно выложила DeepSeek

Это среда исполнения, а не модель

Harness — runtime на Node.js: цикл, в котором модель живёт и работает. Несмотря на название, к API самой DeepSeek он не привязан: подключаются OpenAI, Anthropic, другие провайдеры каталога и любой OpenAI-совместимый сервер. Режимов несколько: обычный, кодовый (модель управляет приложением, написав код), творческий и минимальный.

Принцип «всё — плагин»

Архитектура построена на метафреймворке Cordis, умеющем добавлять и убирать компоненты на лету. Плагинами сделаны адаптер модели, реестр инструментов, навыки, сессии, песочницы, хранилище, оркестрация, интерфейс — и сам цикл агента, то есть правила «подумал → вызвал инструмент → посмотрел результат → пошёл дальше». Смысл для практика: чтобы встроить свою логику согласований, не нужно форкать половину проекта.

Из чего состоит агент, кроме модели

Формулировка «сделали агента из модели» прячет объём работы. Модель умеет одно: получить текст и выдать текст, иногда — с просьбой вызвать инструмент. Остальное — инженерия вокруг, и она определяет, будет агент полезен или опасен.

Инструменты и то, что они возвращают

Инструмент — это не только код, но и описание, схема аргументов и поведение при ошибке. Плохо описанный инструмент хуже отсутствующего: модель дёргает его невпопад. Важно и что он возвращает: сорок килобайт сырого JSON на «найди заказ» съедают контекст и топят в шуме то, ради чего вызов делался.

Память: короткая и длинная

Короткая память — история текущей задачи: конечна, дорога, требует обрезки. Длинная — база фактов и прошлых решений, куда агент ходит поиском. Здесь прячется тихая беда: в неё легко попадают протухающие факты вроде вчерашних цифр, а всплывают они потом как истина. Спасает разметка «что живёт вечно, а что имеет срок годности».

Планирование и цикл

Агент без плана — это модель, делающая первый пришедший шаг, потом второй, и так до исчерпания терпения. Рабочий цикл иной: составить план, выполнить шаг, сверить результат, при расхождении план переписать. В агентном режиме Schai GPT план виден в чате целиком — это не украшение, а самый дешёвый способ заметить, что задачу поняли не так, до того как что-то сделано.

Проверка результата

Самый пропускаемый слой. Без него агент уверенно рапортует об успехе там, где ничего не вышло: файл не сохранился, письмо ушло не туда, поиск вернул пустоту. Проверки бывают дешёвые (прогнать тест, открыть ссылку, пересчитать сумму) и дорогие (вторая модель судьёй). Правило «шаг не сделан, пока не подтверждён наблюдаемым фактом» экономит больше, чем апгрейд модели.
Шесть слоёв обвязки: сама модель отвечает только за «подумать и сказать»

Конструктор против «просто API»

Что придётся написать самому

На голом API вы пишете сами: цикл вызовов и условие остановки, реестр инструментов с валидацией аргументов, обрезку истории, повторы при сбоях, лимиты шагов и денег, журнал, песочницу, подтверждения, хранение сессий и параллельность. Это не вечер работы — и это тот код, в котором все ошибаются одинаково.

За что платят конструктору

К августу 2026 рынок сложился в узнаваемый набор: LangGraph — граф состояний с чекпойнтами и откатом, выбор для продакшна; OpenAI Agents SDK — быстрый старт и песочница, но с привязкой к провайдеру; CrewAI — ролевые команды агентов в двадцать строк; AG2 — общинный наследник AutoGen; smolagents — лёгкий вариант у HuggingFace. Harness встал в этот ряд как runtime, где заменяемо всё, включая цикл. Плата за удобство везде одна: чужие абстракции труднее отлаживать, а главный вопрос эксплуатации — «на каком шаге агент свернул не туда» — упирается в журналы, а не в красоту API.

Сколько это стоит в токенах

Почему счёт растёт быстрее, чем число шагов

На каждом шаге агент отправляет модели всю накопленную историю: задачу, план, прошлые вызовы, ответы инструментов. Тридцатый шаг стоит не как первый, а как первый плюс двадцать девять предыдущих: расход по входу растёт примерно квадратично от числа шагов. Отсюда и сюрприз в счёте у тех, кто «просто поставил агента поработать».

Прикидка на тридцати шагах

Возьмём обычный цикл: 30 шагов, стартовый контекст 5 тысяч токенов, каждый шаг добавляет около 2 тысяч. Средний вход — порядка 35 тысяч токенов, итого около миллиона токенов входа и 30-40 тысяч выхода на задачу. На модели уровня V4-Pro (порядка сорока центов за миллион входных и под доллар за миллион выходных) это меньше доллара; на верхних флагманах — в разы дороже, и разница видна уже на сотне задач в день.
Рычагов два. Кэш промпта: повторный ввод у DeepSeek дешевле «промаха» примерно на два порядка, а агент как раз шлёт один и тот же префикс. И дисциплина инструментов: не тащить в контекст то, что можно записать в файл и прочитать выборочно. Отдельно — предохранитель: застрявший агент пробует снова и снова и жжёт бюджет молча, поэтому лимит шагов и денег обязателен.

Где агент пока проигрывает человеку

Надёжность важнее среднего результата

Бенчмарк τ-bench ввёл метрику pass^k — вероятность справиться k раз подряд, и разрыв вышел показательный: около 61% с первой попытки против 25% на восьми повторах, задачи одни и те же. Для демонстрации это отличный агент, для процесса на тысячу запусков в день — источник ежедневных разборов. Спрашивать надо не «получилось ли», а «получается ли стабильно».

Длинный горизонт

С ростом длины задачи успех падает резко: цепочка из полусотни шагов разваливается не потому, что модель поглупела, а потому что ошибка на шаге двенадцать тихо переносится дальше. Есть и отдельная линейка измерений — насколько длинную работу агент дотягивает до конца хотя бы в половине случаев. Вывод: резать задачу на куски, каждый из которых проверяется отдельно.

Условия, которые нигде не записаны

Человек знает, что этому клиенту скидку не дают, что в пятницу вечером ничего не выкатывают, что с этим подрядчиком общаются только письмом. Агент не знает — и уверенно делает: всё, что держится на «ну это же очевидно», для него не существует. То же с несимметричной ценой ошибки: где неудача дороже удачи, автономность невыгодна и при высоком проценте успеха.

Бенчмаркам не стоит верить дословно

GAIA, SWE-bench Verified, OSWorld, WebArena, τ²-bench — набор, по которому меряются все. Верхние результаты в 74-94%, по оценкам исследователей, завышены на 5-15 пунктов из-за утечек в обучающие данные, качества обвязки и публикации лучшего прогона вместо среднего; WebArena вдобавок плохо воспроизводится. И главное: цифры всё чаще измеряют инженерию вокруг модели, а не модель, — на ваш процесс они не переносятся.

Обязательные предохранители

Это не список пожеланий, а минимум, без которого автономного агента не стоит подпускать к рабочим данным. Каждый пункт закрывает сценарий ущерба, уже случавшийся у кого-то до вас.
Лестница прав: агент поднимается на ступень выше только по явному решению человека

1. Права — это настройка, а не просьба

Строчка в системном промпте «ничего не удаляй без подтверждения» защитой не является: модель может её не выполнить, а может и получить противоположную инструкцию извне. Ограничение работает, когда возможности физически нет: отдельная учётная запись, ключ только на чтение, доступ к одной папке вместо всего диска. Лестница из четырёх ступеней: смотреть → делать обратимое → делать с подтверждением → не делать никогда.

2. Песочница и обратимость

Код выполняется в контейнере, файлы правятся в отдельной ветке, база берётся тестовая. Идеал — чтобы у каждого действия существовало обратное. Если действие необратимо (платёж, рассылка, удаление аккаунта, публикация от лица компании), кнопки у агента быть не должно. В Schai GPT это доведено до принципа: агент доводит работу до готового черновика и останавливается перед публикацией.

3. Недоверенный текст — это данные, а не команды

Главная дыра автономных агентов. Всё прочитанное — страница, письмо, PDF, ответ чужого API — может содержать инструкцию для него самого. В апреле 2026 года это показали на живых инструментах: вредоносные указания клали в заголовки pull request'ов на GitHub и уводили секреты CI у популярных кодовых агентов. Лечится не уговорами модели, а архитектурой: вывод инструмента помечается как данные, опасные действия после чтения внешнего источника требуют подтверждения, токены выдаются под конкретную операцию. В первой версии протокола MCP обязательной аутентификации и точечных прав не было вовсе — обновление 2026 года добавило запрос минимальных доступов под каждый вызов.

4. Человек в правильной точке

«Подтверждать всё» бессмысленно: автономность исчезает, а человек перестаёт читать. Работает список — какие операции необратимы, какие затрагивают чужие данные, какие дороже определённой суммы, — плюс правило «N шагов без прогресса, спроси». Важна и форма: показывать не «выполнить действие?», а план с конкретными аргументами.

5. Лимиты и журнал

Бюджет шагов, времени и денег — жёсткий, с остановкой, а не с предупреждением. Журнал — полный: какой запрос ушёл, какой инструмент вызван, с какими аргументами, что вернул. Без него разбор инцидента невозможен, а инцидент рано или поздно будет. Сессии хранить в базе, а не в памяти процесса: перезапуск сервиса не должен стирать историю действий агента.

6. И один нетехнический

Ответственность за результат остаётся на человеке, который агента запустил: ни лицензия MIT, ни оговорки провайдера её не переносят. Опора — карта угроз OWASP Agentic Security Initiative: как стартовый чек-лист хороша, как замена своему анализу рисков — нет.

Что с этим делать на практике

Начинать стоит с нижней ступени: агент-наблюдатель читает, ищет и предлагает, но ничего не меняет. Через две недели видно, где он экономит время, а где имитирует работу. Дальше — по одной ступени и по одному инструменту, каждый раз спрашивая: что будет, если шаг выполнится неправильно двадцать раз подряд.
Агент — это не умная модель. Это обычная модель, аккуратно ограниченная в правах и снабжённая способом проверять себя.
Выход Harness ценен как маркер: гонка сместилась с моделей на обвязку, а открытый код означает, что цикл, права и журналы можно увидеть и переписать под себя, а не принимать на веру. Модель вы поменяете ещё не раз — инструменты, границы и проверки вокруг неё останутся.
0

Пока нет комментариев

Как собирают ИИ-агента: что нужно кроме модели