13 августа 2026 года DeepSeek выложила в открытый доступ то, чего от неё ждали меньше всего, — не модель, а обвязку. DeepSeek Harness, developer preview под лицензией MIT, запускается одной командой через npx и превращает языковую модель в агента: он читает и правит файлы проекта, выполняет команды, ищет информацию, строит план и раздаёт работу субагентам. Репозиторий за считаные часы собрал десятки тысяч звёзд. Заодно компания довела до релиза флагманскую V4-Pro, заточенную под агентные нагрузки.
Интереснее самой платформы сдвиг, который она подсвечивает: ценность переехала из модели в то, что вокруг неё. Ниже — разбор: из чего агент состоит, чем конструктор отличается от голого API, во что обходятся десятки шагов и какие предохранители обязательны.
Что именно выложила DeepSeek
Это среда исполнения, а не модель
Harness — runtime на Node.js: цикл, в котором модель живёт и работает. Несмотря на название, к API самой DeepSeek он не привязан: подключаются OpenAI, Anthropic, другие провайдеры каталога и любой OpenAI-совместимый сервер. Режимов несколько: обычный, кодовый (модель управляет приложением, написав код), творческий и минимальный.
Принцип «всё — плагин»
Архитектура построена на метафреймворке Cordis, умеющем добавлять и убирать компоненты на лету. Плагинами сделаны адаптер модели, реестр инструментов, навыки, сессии, песочницы, хранилище, оркестрация, интерфейс — и сам цикл агента, то есть правила «подумал → вызвал инструмент → посмотрел результат → пошёл дальше». Смысл для практика: чтобы встроить свою логику согласований, не нужно форкать половину проекта.
Из чего состоит агент, кроме модели
Формулировка «сделали агента из модели» прячет объём работы. Модель умеет одно: получить текст и выдать текст, иногда — с просьбой вызвать инструмент. Остальное — инженерия вокруг, и она определяет, будет агент полезен или опасен.
Инструменты и то, что они возвращают
Инструмент — это не только код, но и описание, схема аргументов и поведение при ошибке. Плохо описанный инструмент хуже отсутствующего: модель дёргает его невпопад. Важно и что он возвращает: сорок килобайт сырого JSON на «найди заказ» съедают контекст и топят в шуме то, ради чего вызов делался.
Память: короткая и длинная
Короткая память — история текущей задачи: конечна, дорога, требует обрезки. Длинная — база фактов и прошлых решений, куда агент ходит поиском. Здесь прячется тихая беда: в неё легко попадают протухающие факты вроде вчерашних цифр, а всплывают они потом как истина. Спасает разметка «что живёт вечно, а что имеет срок годности».
Планирование и цикл
Агент без плана — это модель, делающая первый пришедший шаг, потом второй, и так до исчерпания терпения. Рабочий цикл иной: составить план, выполнить шаг, сверить результат, при расхождении план переписать. В агентном режиме Schai GPT план виден в чате целиком — это не украшение, а самый дешёвый способ заметить, что задачу поняли не так, до того как что-то сделано.
Проверка результата
Самый пропускаемый слой. Без него агент уверенно рапортует об успехе там, где ничего не вышло: файл не сохранился, письмо ушло не туда, поиск вернул пустоту. Проверки бывают дешёвые (прогнать тест, открыть ссылку, пересчитать сумму) и дорогие (вторая модель судьёй). Правило «шаг не сделан, пока не подтверждён наблюдаемым фактом» экономит больше, чем апгрейд модели.

Конструктор против «просто API»
Что придётся написать самому
На голом API вы пишете сами: цикл вызовов и условие остановки, реестр инструментов с валидацией аргументов, обрезку истории, повторы при сбоях, лимиты шагов и денег, журнал, песочницу, подтверждения, хранение сессий и параллельность. Это не вечер работы — и это тот код, в котором все ошибаются одинаково.
За что платят конструктору
К августу 2026 рынок сложился в узнаваемый набор: LangGraph — граф состояний с чекпойнтами и откатом, выбор для продакшна; OpenAI Agents SDK — быстрый старт и песочница, но с привязкой к провайдеру; CrewAI — ролевые команды агентов в двадцать строк; AG2 — общинный наследник AutoGen; smolagents — лёгкий вариант у HuggingFace. Harness встал в этот ряд как runtime, где заменяемо всё, включая цикл. Плата за удобство везде одна: чужие абстракции труднее отлаживать, а главный вопрос эксплуатации — «на каком шаге агент свернул не туда» — упирается в журналы, а не в красоту API.
Сколько это стоит в токенах
Почему счёт растёт быстрее, чем число шагов
На каждом шаге агент отправляет модели всю накопленную историю: задачу, план, прошлые вызовы, ответы инструментов. Тридцатый шаг стоит не как первый, а как первый плюс двадцать девять предыдущих: расход по входу растёт примерно квадратично от числа шагов. Отсюда и сюрприз в счёте у тех, кто «просто поставил агента поработать».
Прикидка на тридцати шагах
Возьмём обычный цикл: 30 шагов, стартовый контекст 5 тысяч токенов, каждый шаг добавляет около 2 тысяч. Средний вход — порядка 35 тысяч токенов, итого около миллиона токенов входа и 30-40 тысяч выхода на задачу. На модели уровня V4-Pro (порядка сорока центов за миллион входных и под доллар за миллион выходных) это меньше доллара; на верхних флагманах — в разы дороже, и разница видна уже на сотне задач в день.
Рычагов два. Кэш промпта: повторный ввод у DeepSeek дешевле «промаха» примерно на два порядка, а агент как раз шлёт один и тот же префикс. И дисциплина инструментов: не тащить в контекст то, что можно записать в файл и прочитать выборочно. Отдельно — предохранитель: застрявший агент пробует снова и снова и жжёт бюджет молча, поэтому лимит шагов и денег обязателен.
Где агент пока проигрывает человеку
Надёжность важнее среднего результата
Бенчмарк τ-bench ввёл метрику pass^k — вероятность справиться k раз подряд, и разрыв вышел показательный: около 61% с первой попытки против 25% на восьми повторах, задачи одни и те же. Для демонстрации это отличный агент, для процесса на тысячу запусков в день — источник ежедневных разборов. Спрашивать надо не «получилось ли», а «получается ли стабильно».
Длинный горизонт
С ростом длины задачи успех падает резко: цепочка из полусотни шагов разваливается не потому, что модель поглупела, а потому что ошибка на шаге двенадцать тихо переносится дальше. Есть и отдельная линейка измерений — насколько длинную работу агент дотягивает до конца хотя бы в половине случаев. Вывод: резать задачу на куски, каждый из которых проверяется отдельно.
Условия, которые нигде не записаны
Человек знает, что этому клиенту скидку не дают, что в пятницу вечером ничего не выкатывают, что с этим подрядчиком общаются только письмом. Агент не знает — и уверенно делает: всё, что держится на «ну это же очевидно», для него не существует. То же с несимметричной ценой ошибки: где неудача дороже удачи, автономность невыгодна и при высоком проценте успеха.
Бенчмаркам не стоит верить дословно
GAIA, SWE-bench Verified, OSWorld, WebArena, τ²-bench — набор, по которому меряются все. Верхние результаты в 74-94%, по оценкам исследователей, завышены на 5-15 пунктов из-за утечек в обучающие данные, качества обвязки и публикации лучшего прогона вместо среднего; WebArena вдобавок плохо воспроизводится. И главное: цифры всё чаще измеряют инженерию вокруг модели, а не модель, — на ваш процесс они не переносятся.
Обязательные предохранители
Это не список пожеланий, а минимум, без которого автономного агента не стоит подпускать к рабочим данным. Каждый пункт закрывает сценарий ущерба, уже случавшийся у кого-то до вас.

1. Права — это настройка, а не просьба
Строчка в системном промпте «ничего не удаляй без подтверждения» защитой не является: модель может её не выполнить, а может и получить противоположную инструкцию извне. Ограничение работает, когда возможности физически нет: отдельная учётная запись, ключ только на чтение, доступ к одной папке вместо всего диска. Лестница из четырёх ступеней: смотреть → делать обратимое → делать с подтверждением → не делать никогда.
2. Песочница и обратимость
Код выполняется в контейнере, файлы правятся в отдельной ветке, база берётся тестовая. Идеал — чтобы у каждого действия существовало обратное. Если действие необратимо (платёж, рассылка, удаление аккаунта, публикация от лица компании), кнопки у агента быть не должно. В Schai GPT это доведено до принципа: агент доводит работу до готового черновика и останавливается перед публикацией.
3. Недоверенный текст — это данные, а не команды
Главная дыра автономных агентов. Всё прочитанное — страница, письмо, PDF, ответ чужого API — может содержать инструкцию для него самого. В апреле 2026 года это показали на живых инструментах: вредоносные указания клали в заголовки pull request'ов на GitHub и уводили секреты CI у популярных кодовых агентов. Лечится не уговорами модели, а архитектурой: вывод инструмента помечается как данные, опасные действия после чтения внешнего источника требуют подтверждения, токены выдаются под конкретную операцию. В первой версии протокола MCP обязательной аутентификации и точечных прав не было вовсе — обновление 2026 года добавило запрос минимальных доступов под каждый вызов.
4. Человек в правильной точке
«Подтверждать всё» бессмысленно: автономность исчезает, а человек перестаёт читать. Работает список — какие операции необратимы, какие затрагивают чужие данные, какие дороже определённой суммы, — плюс правило «N шагов без прогресса, спроси». Важна и форма: показывать не «выполнить действие?», а план с конкретными аргументами.
5. Лимиты и журнал
Бюджет шагов, времени и денег — жёсткий, с остановкой, а не с предупреждением. Журнал — полный: какой запрос ушёл, какой инструмент вызван, с какими аргументами, что вернул. Без него разбор инцидента невозможен, а инцидент рано или поздно будет. Сессии хранить в базе, а не в памяти процесса: перезапуск сервиса не должен стирать историю действий агента.
6. И один нетехнический
Ответственность за результат остаётся на человеке, который агента запустил: ни лицензия MIT, ни оговорки провайдера её не переносят. Опора — карта угроз OWASP Agentic Security Initiative: как стартовый чек-лист хороша, как замена своему анализу рисков — нет.
Что с этим делать на практике
Начинать стоит с нижней ступени: агент-наблюдатель читает, ищет и предлагает, но ничего не меняет. Через две недели видно, где он экономит время, а где имитирует работу. Дальше — по одной ступени и по одному инструменту, каждый раз спрашивая: что будет, если шаг выполнится неправильно двадцать раз подряд.
Агент — это не умная модель. Это обычная модель, аккуратно ограниченная в правах и снабжённая способом проверять себя.
Выход Harness ценен как маркер: гонка сместилась с моделей на обвязку, а открытый код означает, что цикл, права и журналы можно увидеть и переписать под себя, а не принимать на веру. Модель вы поменяете ещё не раз — инструменты, границы и проверки вокруг неё останутся.


Пока нет комментариев