В декабре 2024 Gartner предсказал что «минимум 30% generative-AI проектов будут заброшены после proof-of-concept к концу 2025 — из-за плохого качества данных, недостаточных risk controls, эскалирующих costs или неясного business value». Мы видим ту же цифру в практике — но не из-за качества данных. Реальные убийцы — организационные, не технические.
Вот разбор 14 пилотов от польских, немецких и американских клиентов в 2023–2025. Три умерли. Два ушли в постоянный zombie-режим («мы всё ещё оцениваем»). Девять поехали в прод. Паттерны удивительно одинаковые.
Ошибка #1: слишком широкий scope в pilot
Ритейлер попросил «AI-агента, который ответит на все входящие вопросы». Это не pilot, это 3-летняя дорожная карта. Мы сузили до «отвечать про статус заказа и сроки доставки на польском, всё остальное эскалировать». Pilot поехал за 5 недель. Original brief занял бы 9 месяцев и €120K.
Ошибка #2: нет baseline метрик
Нельзя доказать что AI сэкономил деньги, если не знаешь что было раньше. Логистический клиент гордо отчитывался «AI обрабатывает 60% звонков от водителей». Хорошо. А раньше сколько было? Никто не мерил. CFO зарубил продление.
Потрать 1–2 недели в начале на замеры: объём звонков, average handle time, escalation rate, FCR, cost per ticket. Без этих цифр у тебя нет story для steering committee на 6-м месяце.
Ошибка #3: bus factor = 1
Три пилота встали потому что единственный инженер ушёл в другую компанию. AI-агенты содержат implicit context: решения по prompt engineering, edge-case handlers, monitoring rules. Документируй всё в runbook с первой недели.
Ошибка #4: синтетические данные вместо production-логов
Команда тестировала на 50 synthetic call transcripts которые сами написали. Production-звонки имели 4× больше перебиваний, акценты которых team не предвидел, фоновый шум из open-plan офисов, и 7% звонящих использовали смешанные языки (польский + английский). Accuracy упал с 94% в тестах до 71% в проде.
Ошибка #5: нет fallback пути
Когда LLM лежит, агент молча failит. Был инцидент в пятницу вечером — Claude API rate-limited нас на 23 минуты. Без fallback на человека бот просто бросал трубки. 240 потерянных звонков.
Каждый production-агент нуждается в трёх fallback'ах: a) retry на другой модели, b) graceful «давайте я вас переключу» с hold-музыкой, c) пост-инцидент SMS для follow-up.
Ошибка #6: платишь за консалтинг, а не за код
Vendor взял €40K за «discovery phase» — 60-страничный документ с personas, journey maps и roadmap. Ноль кода. Через 6 месяцев у клиента ничего в проде. Мы переделали за 5 недель за €18K включая самого агента.
Discovery имеет value, но cap его на 10–15% общего бюджета. Если vendor хочет больше за «research» — он продаёт презентацию, не deployment.
Ошибка #7: нет human-in-the-loop
Pilot в healthcare авто-отменял appointments based on AI-интерпретацию сообщений пациентов. Через 2 недели команда patient relations была завалена жалобами. Fix — 2-строчное изменение кода: любой cancel триггерит confirmation message, потом 30-min hold перед action. Жалобы исчезли.
Ошибка #8: игнорирование edge cases
Edge cases в voice-агентах которые мы поймали в проде:
- —Caller передаёт телефон ребёнку посередине разговора
- —Фоновое TV-news триггерит intent «переключите на человека»
- —Caller говорит на 3 языках в одном предложении (PL + UA + RU)
- —Телефон звонит на динамике в машине — шум двигателя ломает STT
- —Caller бросает трубку посередине предложения; агент продолжает говорить в мёртвую линию
- —Номер был переназначен — отвечает не тот клиент
Их не поймаешь в тестах. Поймаешь в первые 2 недели прода с active monitoring. Заложи 20% бюджета первой недели на triage.
Ошибка #9: нет measurement после deploy
Три наших клиента запустили агентов и потом... никогда не смотрели. Через 6 месяцев не могли ответить, работает ли он. Всегда настраивай: error-rate alerting, weekly transcript sampling (минимум 50 звонков), monthly steering review с одним accountable человеком.
Чек-лист до kickoff
| Пункт | Status | Owner |
|---|---|---|
| Single intent, single channel scope написан | Required | Product |
| Baseline метрики измерены 1+ неделю | Required | Ops |
| Два инженера знают систему | Required | Eng |
| 200+ реальных production samples доступны | Required | Data |
| Fallback path определён и протестирован | Required | Eng |
| Discovery budget capped ≤15% | Required | CFO |
| HITL approval flow для sensitive actions | Required | Compliance |
| Monitoring + weekly review scheduled | Required | Ops |
Если уже застрял
Большинство «застрявших пилотов» которые мы adopt-им имеют одну fixable cause — обычно #2 (нет baseline) или #5 (нет fallback). Три недели focused работы обычно их разблокируют. Пришли 30-минутную screen-recording где агент фейлит — скажем какие из 9 ты hit-нул.