Кейсы22 апр 2026 · 12 мин чтения

Почему 70% AI-пилотов умирают — 9 ошибок, которые их убивают

Gartner прогнозирует что 30% GenAI-проектов будут заброшены после pilot к концу 2025. Разбор 14 наших клиентских внедрений: 3 умерли, 2 застряли в зомби-режиме, 9 поехали в прод. Паттерны провалов.

В декабре 2024 Gartner предсказал что «минимум 30% generative-AI проектов будут заброшены после proof-of-concept к концу 2025 — из-за плохого качества данных, недостаточных risk controls, эскалирующих costs или неясного business value». Мы видим ту же цифру в практике — но не из-за качества данных. Реальные убийцы — организационные, не технические.

Вот разбор 14 пилотов от польских, немецких и американских клиентов в 2023–2025. Три умерли. Два ушли в постоянный zombie-режим («мы всё ещё оцениваем»). Девять поехали в прод. Паттерны удивительно одинаковые.

Ошибка #1: слишком широкий scope в pilot

Ритейлер попросил «AI-агента, который ответит на все входящие вопросы». Это не pilot, это 3-летняя дорожная карта. Мы сузили до «отвечать про статус заказа и сроки доставки на польском, всё остальное эскалировать». Pilot поехал за 5 недель. Original brief занял бы 9 месяцев и €120K.

tip
Правило pilot: один канал, один язык, один intent. Сопротивляйся scope creep письменным one-page agreement до kickoff.

Ошибка #2: нет baseline метрик

Нельзя доказать что AI сэкономил деньги, если не знаешь что было раньше. Логистический клиент гордо отчитывался «AI обрабатывает 60% звонков от водителей». Хорошо. А раньше сколько было? Никто не мерил. CFO зарубил продление.

Потрать 1–2 недели в начале на замеры: объём звонков, average handle time, escalation rate, FCR, cost per ticket. Без этих цифр у тебя нет story для steering committee на 6-м месяце.

Ошибка #3: bus factor = 1

Три пилота встали потому что единственный инженер ушёл в другую компанию. AI-агенты содержат implicit context: решения по prompt engineering, edge-case handlers, monitoring rules. Документируй всё в runbook с первой недели.

Ошибка #4: синтетические данные вместо production-логов

Команда тестировала на 50 synthetic call transcripts которые сами написали. Production-звонки имели 4× больше перебиваний, акценты которых team не предвидел, фоновый шум из open-plan офисов, и 7% звонящих использовали смешанные языки (польский + английский). Accuracy упал с 94% в тестах до 71% в проде.

warning
Всегда тестируй минимум на 200 реальных production samples перед запуском. Анонимизируй, но не синтезируй.

Ошибка #5: нет fallback пути

Когда LLM лежит, агент молча failит. Был инцидент в пятницу вечером — Claude API rate-limited нас на 23 минуты. Без fallback на человека бот просто бросал трубки. 240 потерянных звонков.

Каждый production-агент нуждается в трёх fallback'ах: a) retry на другой модели, b) graceful «давайте я вас переключу» с hold-музыкой, c) пост-инцидент SMS для follow-up.

Ошибка #6: платишь за консалтинг, а не за код

Vendor взял €40K за «discovery phase» — 60-страничный документ с personas, journey maps и roadmap. Ноль кода. Через 6 месяцев у клиента ничего в проде. Мы переделали за 5 недель за €18K включая самого агента.

Discovery имеет value, но cap его на 10–15% общего бюджета. Если vendor хочет больше за «research» — он продаёт презентацию, не deployment.

Ошибка #7: нет human-in-the-loop

Pilot в healthcare авто-отменял appointments based on AI-интерпретацию сообщений пациентов. Через 2 недели команда patient relations была завалена жалобами. Fix — 2-строчное изменение кода: любой cancel триггерит confirmation message, потом 30-min hold перед action. Жалобы исчезли.

Ошибка #8: игнорирование edge cases

Edge cases в voice-агентах которые мы поймали в проде:

  • Caller передаёт телефон ребёнку посередине разговора
  • Фоновое TV-news триггерит intent «переключите на человека»
  • Caller говорит на 3 языках в одном предложении (PL + UA + RU)
  • Телефон звонит на динамике в машине — шум двигателя ломает STT
  • Caller бросает трубку посередине предложения; агент продолжает говорить в мёртвую линию
  • Номер был переназначен — отвечает не тот клиент

Их не поймаешь в тестах. Поймаешь в первые 2 недели прода с active monitoring. Заложи 20% бюджета первой недели на triage.

Ошибка #9: нет measurement после deploy

Три наших клиента запустили агентов и потом... никогда не смотрели. Через 6 месяцев не могли ответить, работает ли он. Всегда настраивай: error-rate alerting, weekly transcript sampling (минимум 50 звонков), monthly steering review с одним accountable человеком.

Чек-лист до kickoff

ПунктStatusOwner
Single intent, single channel scope написанRequiredProduct
Baseline метрики измерены 1+ неделюRequiredOps
Два инженера знают системуRequiredEng
200+ реальных production samples доступныRequiredData
Fallback path определён и протестированRequiredEng
Discovery budget capped ≤15%RequiredCFO
HITL approval flow для sensitive actionsRequiredCompliance
Monitoring + weekly review scheduledRequiredOps

Если уже застрял

Большинство «застрявших пилотов» которые мы adopt-им имеют одну fixable cause — обычно #2 (нет baseline) или #5 (нет fallback). Три недели focused работы обычно их разблокируют. Пришли 30-минутную screen-recording где агент фейлит — скажем какие из 9 ты hit-нул.

Читайте дальше

Смотреть услугу

Newsletter

Любишь такие разборы?

Раз в неделю — короткое письмо с цифрами с наших внедрений.