Куда внедрять агентов.
Фронт или тыл
Где ставить ИИ-агентов — к клиенту или во внутренние процессы — и почему рынок откатывает одно, а второе оставляет. Исследования 2025–2026 и живая площадка.
Куда ушёл хайп первой линии
На волне генеративных моделей бизнес почти везде ставил на одно и то же: выпустить языкового агента к клиенту — в поддержку, в продажи, в рекомендации — и срезать стоимость первой линии. К 2026 году картина стала жёстче. Крупные исследования фиксируют массовые откаты автономных диалоговых систем на внешнем контуре, а деньги и внимание смещаются внутрь компании: сверки, разборы ошибок, переводы, знания, дежурство по инцидентам.
Это не мораль «ИИ не взлетел». Это разбор, почему внешний контур так часто ломается о поведение людей и хаос в данных, почему внутренний даёт окупаемость проще, и как та же геометрия выглядит не в слайде, а на живой инфраструктуре — без имён проектов и без сказок про «заменили весь отдел».
Анатомия провала снаружи: каскад, а не «глупая модель»
Главная иллюзия ранних внедрений была простой: достаточно сильной модели, аккуратного промпта и кнопки «в прод». Дальше агент сам ведёт диалог, сам принимает решения, сам закрывает заявку. На бумаге это выглядит как замена оператора. На практике внешний контур — это цепочка шагов, а не один красивый ответ.
Если сценарий из трёх звеньев — узнать клиента, проверить условия, выполнить действие — и на каждом звене автономный агент даёт, условно, семьдесят процентов корректности, итог всей цепочки это уже не семьдесят. Это произведение: ноль целых семь на ноль целых семь на ноль целых семь — примерно тридцать четыре процента. Две трети пользователей в таком сценарии где-то спотыкаются. Это не приговор конкретной модели. Это математика последовательных ошибок: чем длиннее автономия без человека, тем быстрее падает надёжность всего маршрута.
Исследование Sinch The AI Production Paradox (май 2026, около двух с половиной тысяч руководителей) даёт рыночный удар по той же теме: семьдесят четыре процента организаций уже откатывали или полностью выключали живой агент клиентских коммуникаций после вывода в прод. В публичных формулировках отчёта ключевое слово — не «модель слабая», а управление и контроль: аудит, предсказуемость, понимание, когда агент ушёл в сторону. Откат часто не «нейросеть не умеет», а «мы не можем за неё отвечать».
Отчёт MIT по линии NANDA (The GenAI Divide / State of AI in Business 2025) добавляет финансовый слой: порядка девяноста пяти процентов корпоративных пилотов генеративного ИИ не дают измеримого эффекта на финансовый результат. Здесь нужна честность к цифре: это не «только чат-боты поддержки», это шире — про пилоты вообще. Но связка с внешним контуром прямая: туда уходили самые шумные бюджеты, а измеримая отдача чаще оказывалась внутри, где короче путь от ответа модели до пользы.
Отдельно — данные. Когда каталог товаров не связан, карточки клиента размазаны по системам, а правила поддержки живут в головах старших операторов, модель не «додумывает правду». Она заполняет дыры уверенным тоном. Снаружи это выглядит как враньё клиенту. Корень часто не в архитектуре модели, а в том, что знание компании не собрано в вид, из которого можно безопасно отвечать наружу.
Попытка закрыть риск второй моделью-судьёй — «пусть одна пишет, вторая проверяет» — на живом трафике даёт ложное спокойствие. Модели одной семьи нередко прощают друг другу стилистически гладкие, но фактологически кривые ответы. На тестах метрики зелёные, на клиентах — скандал. Судья из той же семьи — не замена человеку там, где цена ошибки — деньги, доступ или доверие.
Зачем всё равно лезли на клиента — и чем закончилось
Осторожность традиционных банков и ритейла понятна. Менее понятно, зачем цифровые сервисы «с нуля» сознательно выкатывали сырое. Здесь ответ чаще не в наивности, а в юнит-экономике.
У сервиса без отделений маржа сидит на стоимости обслуживания одного клиента. Если база растёт, а первая линия растёт линейно штатом, экономика разваливается. Запустить модель с точностью «семьдесят пять — восемьдесят» и дорабатывать её на живом потоке для таких компаний часто выглядело дешевле, чем держать тысячный колл-центр. Плюс живой клиент — это бесплатный набор сложных формулировок, которых нет в лабораторных тестах: эскалация на человека после сбоя даёт готовый разбор «где агент сломался».
Это работало до порога доверия. Мелкий сбой в «где мой перевод» ещё прощают. Галлюцинация в «карту заблокировали / счёт заморожен» — уже отток. К 2026 году рабочим стандартом на внешнем контуре становится не «полная автономия», а гибрид: модель закрывает шаблон, а при падении уверенности или в чувствительной теме сессию забирает человек — желательно до того, как клиент понял, что его водят кругами.
С собственной площадки я вижу ту же геометрию, только в меньшем масштабе. Там, где ответ уходит наружу — в чат по материалам, в пояснение выделенного текста, в публичные комментарии, в мультимодельный песочничный чат — почти никогда нет «голого» агента. Есть лимиты по частоте, узкая роль («ответь коротко по курсу», «два-три предложения простыми словами»), антифрод с десятками сигналов, подпись что это машина, уведомление человеку о живом комментарии. Это не потому что «так написано в отчёте». Это потому что цена стыда и стоимость разбора инцидента на внешнем контуре выше, чем экономия на одном операторе.
Ещё жёстче пример — разбор ложных блокировок на периметре. Когда система безопасности режет доступ, пользователь видит не глухую стену, а кнопку вроде «проверить, это не я». Сервис собирает контекст: сценарий бана, заголовки браузера, недавние запросы в журнале, признак «общий выход на миллионы людей». Языковая модель выдаёт одно из двух: ложное срабатывание — снять, или атака — оставить. Если модель или инфраструктура сбоит, решение не записывается как окончательное: человек может повторить. Если вердикт «атака», путь не «молча навсегда», а форма на ручную проверку с уведомлением владельцу.
С мая по сейчас в журнале таких разборов сто четырнадцать. Из них сто десять — ложное срабатывание (сняли), четыре — подтверждённая атака (оставили). Ручных заявок при этом ноль: автоконтура пока хватало. Это и есть маршрутизация по уверенности без красивого англоязычного названия: автомат на ясном кейсе, человек на спорном, никаких тихих решений при ошибке движка. На внешнем контуре, где решается доступ живого человека к сервису, полная автономия без второго контура была бы безответственностью.
114 разборов доступа: 110 сняли, 4 оставили. Не «ИИ заменил службу безопасности», а «ИИ ускорил разбор, спорное — человеку».
Тыл: зона, где агенты реально окупаются
Пока внешние диалоги спотыкаются о доверие и данные, внутри компании та же техника часто выглядит скучно и прибыльно. Узкий контекст: регламент, очередь ошибок, очередь переводов, граф задач команды, сверка «коммит закрыл баг». Между ответом модели и внешним миром почти всегда стоит сотрудник — или хотя бы жёсткое правило «в прод сам не пускай».
На площадке это не теория. Агент, который ловит ошибки продакшена, не вливает правки сам: собирает сигналы, отделяет шум от бага, при реальном баге готовит исправление в изолированной копии и открывает заявку на правку для человека. В учёте задач — десятки разборов; статус «закрыто» у большинства, «провал» и «нужен человек» — единицы. Смысл не в «ИИ починил прод», а в том, что черновик фикса появляется быстрее, а кнопка «влить» остаётся человеческой. Это ровно та схема, которую рынок заново открывает для поддержки: машина готовит, человек отвечает.
Тихие внутренние контуры крутятся без хайпа: очередь переводов интерфейса из базы, классификация для поиска, разбор сущностей в командном чате, сопоставление исправляющих коммитов с открытыми задачами, потолок расходов на модели, почасовая проверка «конвейер жив». Узкий вход, повторяемый выход, измеримый сбой. Здесь не нужна «душа собеседника» — нужна дисциплина конвейера.
Есть и цифры, которые уже разбирал отдельно, но они держат тезис. Конвейер проверки фактов по учебному корпусу: семьсот семьдесят проверяемых утверждений, порядка шести долларов и получаса на прогон по фазам — это не клиентский бот, это внутренний контроль качества текста до публикации. Локальная «бесплатная» модель на общем сервере забрала двадцать три и семь десятых гигабайта памяти и отвечала за пять–двенадцать секунд; облачный вызов на ту же задачу — доли доллара в месяц и около секунды. «Бесплатно» на общем железе оказалось самой дорогой опцией. Это тоже про окупаемость: считать надо полную цену, а не только строку в счёте API.
И главное — внутренний контур не свят. Самый честный урок: ИИ-фича без потребителя — это не актив, а налог. Авторазбор багов в командном боте жёг порядка трёх долларов семидесяти центов в день, отчёты никто не читал — выключили. Утренний дайджест переписали с нейросети на прямой запрос к базе: четыре блока, ноль токенов, смысл тот же. Фичи, которыми за две недели не пользовался никто, — снесли. Если в конце останется только «кладите бюджет внутрь», без этой оговорки, получится тот же маркетинг, только с другой стороны. Внутреннее место даёт шанс на окупаемость, но не отменяет вопрос: кто читает вывод и какое решение от него зависит.
Три доллара семьдесят в день на «умный» разбор, который никто не открывал. Выключили. Детерминированный дайджест из базы — ноль токенов, смысл тот же. Тыл тоже умеет жечь деньги впустую.
Не модель «плохая» — ломается обвязка и данные
Когда падает внешний агент, удобно винить модель. На практике часто виноват слой вокруг.
На одном общем сервере после смены железа библиотека векторного поиска в базе начала ронять процесс на каждом расстоянии: две тысячи девятьсот двадцать восемь аварийных сигналов за тринадцать часов, сервисы с поиском по памяти ушли в цикл перезапусков. Пользователь видел «чат не отвечает». Модель была ни при чём — не работал фундамент, на котором висел контекст. В другой истории резервная площадка «оживала» с таймаутом проверки здоровья в пять секунд при холодном старте около двенадцати: скрипт считал подъём проваленным, пока не удлинили ожидание. В третьей — адрес базы был размножен по нескольким файлам; при смене порта посыпались сотни ошибок «не могу найти пользователя». Это не слайды про стратегию. Это то, почему агент на кривой обвязке выглядит «глупым», хотя ломается труба.
Отсюда и развилка по знаниям. Пытаться «запечь» прайс и регламенты в веса модели через дообучение — обычно ошибка: факты стареют, переобучение дорого, аудит «откуда взялось» пропадает. Для что модель знает — актуальная подстановка из своей базы с ссылкой на источник. Для как себя ведёт — формат, тон, короткие ответы, запреты — система ролей, примеры, жёсткие лимиты. Для цены — узкая дистилляция имеет смысл, когда поток большой и формат стабилен; на общем сервере без видеокарты «своя маленькая модель на всё» уже показывала обратный эффект. Правило простое: знания отдельно, поведение отдельно, счёт отдельно — не мешать в один «дообучим и будет».
Что из этого следует
Если собрать рыночные цифры и то, что видно с площадки, получается не лозунг «бросьте клиентских ботов», а более жёсткая и полезная карта.
На внешнем контуре полная автономия пока остаётся маркетинговым мифом для всего, что дороже шаблона. Работающая схема — гибрид: модель закрывает повторяемое, при падении уверенности, в деньгах, доступе и конфликтах — человек, и желательно до того, как клиент понял, что его крутят. Лимиты, узкая роль, журнал, понятный путь «позвать оператора» — не бюрократия, а то, без чего откаты уровня Sinch повторяются у всех.
На внутреннем контуре быстрее появляется измеримая польза: короче путь, уже есть «судья» в лице сотрудника, контекст уже, проще откатить. Но внутрь нельзя сваливать всё подряд. Сначала вопрос: кто потребитель вывода и какое решение от него зависит. Нет потребителя — будет счёт как у отключённого разбора за три семьдесят в день.
На архитектуре не лечить данные промптом. Каталог, права, единый источник правды по правилам поддержки — до «умного» диалога. Цепочку шагов считать произведением надёжностей, а не средним арифметическим «модель в среднем хороша». Знания — из живой базы, поведение — из ролей и ограничений, человека — на шве, где цена ошибки выше стоимости его минуты.
Рынок в 2026 году не «разочаровался в ИИ». Он разочаровался в агенте без обвязки, без данных и без человека на критическом шаге. Свалка, о которой пишут в заголовках, — это в основном свалка наивной автономии на клиенте. Тихий возврат денег — там, где модель ускоряет уже существующую работу, а не изображает отдел поддержки целиком. У себя я вижу то же без слайдов: сто десять из ста четырнадцати спорных банов сняты аккуратно, правки в прод без человека не едут, часть «умных» отчётов мы сами выключили, а чат наружу до сих пор сидит в клетке из лимитов и узкой роли. Это не отсталость. Это та цена, которую рынок только начинает называть вслух.
// Обсуждение
Можно писать анонимно. Укажите email, чтобы получать уведомления об ответах.