Разрабатываем ПО любой сложности для автоматизации бизнеса

Рассчитать стоимость
Тестирование ИИ-систем

Тестирование ИИ-систем и LLM (evals)

Ваш ИИ-ассистент отвечает правильно? Докажем измеримо. Строим evals — регрессионный набор качества для LLM-ассистентов и RAG: прогоняется при каждой смене промпта или модели. Экспресс-оценка — от 60 000 ₽ и 1–2 недель.

Что такое evals и когда пора тестировать ИИ

Evals — это регрессионный набор качества для ИИ-системы: эталонные вопросы, критерии оценки и прогон, который цифрами показывает, где ассистент отвечает верно, а где галлюцинирует.

Когда нужны evals

Обычные тесты проверяют код, у которого есть один правильный ответ. У LLM ответ каждый раз разный, поэтому качество меряют иначе: golden dataset из реальных сценариев, рубрики оценки и повторный прогон после каждого изменения.

Типичные сигналы, что пора тестировать ИИ-систему

  • ИИ-ассистент уже отвечает клиентам, а качество его ответов никто не измерял — «вроде нормально»;
  • ассистент галлюцинирует: выдумывает цены, условия и ссылки, и вы узнаёте об этом от клиентов;
  • качество проверяют перепиской в чате перед релизом — впечатлениями, а не набором;
  • после смены модели или правки промпта ответы «поплыли», и непонятно, что именно сломалось;
  • RAG-бот отвечает не по вашей базе знаний, а «от себя»;
  • ассистента можно увести с темы, выведать системный промпт или чужие данные;
  • заказчик или служба безопасности требуют подтвердить качество ИИ перед запуском.
Сигналы, что ИИ-системе нужны evals: ассистент галлюцинирует, качество проверяют перепиской в чате, после смены модели ответы поплыли

Цена

Экспресс-оценка от 60 000 ₽, evals под ключ от 120 000 ₽

Сроки

Экспресс — 1–2 недели, evals под ключ — 3–5 недель

Формат оплаты

Поэтапный · 30% / 40% / 30%

Что проверяем

Что проверяем в ИИ-системе

Шесть направлений — состав проверки собираем под вашу систему: ассистент поддержки, RAG по базе знаний, ИИ-агент или голосовой бот.

  • Качество ответов.
    Правильность, полнота и тон на эталонных сценариях: где ассистент отвечает верно, где ошибается, где отвечает не то, что нужно бизнесу. Итог — доля верных ответов по каждому типу вопросов.
  • Галлюцинации и выдумки.
    Отдельный контур: выдуманные цены, условия, ссылки и «факты». Для каждого случая фиксируем причину — модель, промпт или база знаний.
  • RAG-качество.
    Проверяем обе половины: находит ли поиск нужные фрагменты (полнота retrieval) и отвечает ли модель по найденному, а не «от себя» (faithfulness — верность источнику).
  • Guardrails: рамки поведения.
    Держит ли ассистент системный промпт, границы тем и тон: не обсуждает конкурентов, не даёт медицинских и юридических советов, не обещает лишнего от имени компании.
  • Устойчивость к атакам.
    Промпт-инъекции прямые и косвенные, jailbreak, выведывание системного промпта и чужих данных — защитная проверка по библиотеке атак и OWASP LLM Top 10.
  • Регрессия при изменениях.
    Главный режим evals: перепрогон набора после смены промпта, модели или базы знаний — в том числе когда модель молча обновил вендор. Работаем с GigaChat, YandexGPT и зарубежными моделями; качество меряем на русском языке — на нём говорят ваши клиенты.

Автотесты для обычного ПО — интерфейсов и API с предсказуемым ответом — это отдельная услуга: автоматизация тестирования. Здесь мы тестируем сами ИИ-системы.

Методика

Как устроен evals-набор

Четыре части, из которых складывается работающий набор. Терминология мировая — объясняем по-русски.

Golden dataset: эталонные вопросы и ответы

Набор реальных сценариев с верными ответами: собираем из живых диалогов, документации и с вашими экспертами.

Это «линейка», которой меряется каждая версия ассистента.

Рубрики оценки вместо «нравится / не нравится»

Формальные критерии: фактическая точность, полнота, соответствие тону, отсутствие выдумок.

По рубрикам один и тот же ответ оценивается одинаково — кем бы ни проверялся.

LLM-as-judge под контролем человека

Ответы массово оценивает модель-судья по нашим рубрикам, спорные случаи проверяет человек.

Сходимость оценок судьи и людей контролируем на выборках — судье, который «плывёт», прогон не доверяем.

Прогон в CI: evals на каждое изменение

Harness — код, который прогоняет весь набор в один клик и строит отчёт.

Встраиваем в ваш CI: правка промпта или смена модели без прогона evals не уезжает в прод.

Развилка

Автотесты, пентест или evals — что нужно вам

Три услуги легко перепутать. Разница — в объекте проверки: код, периметр или ответы модели.

Вопрос
АвтотестыКлассическое ПО
ПентестБезопасность периметра
EvalsТестирование ИИ-систем — здесь
Что проверяем
Интерфейсы и API с предсказуемым ответом
Инфраструктуру и приложения атакой
Ответы LLM: качество, рамки, устойчивость
Эталон результата
Тест прошёл / упал
Уязвимость подтверждена PoC
Замер по рубрикам на golden dataset
Когда запускается
На каждый коммит кода
Периодически или перед релизом
При каждой смене промпта, модели, базы знаний
Типовой заказ
Регресс интернет-магазина
Пентест веб-приложения
Оценка качества ИИ-ассистента поддержки
Наша страница
Вы уже на ней

Если ИИ-ассистент — часть большого продукта, услуги сочетаются: автотесты держат код, evals — качество ответов; наступательную проверку с эксплуатацией уязвимостей делает пентест.

Стоимость

Сколько стоит тестирование ИИ-систем

Экспресс-оценка — от 60 000 ₽, evals под ключ — от 120 000 ₽. Рынок продаёт либо часы, либо «стоимость индивидуально», либо red teaming от миллиона — мы публикуем пакеты с составом и сроком.

Безопасность LLM: промпт-инъекции и guardrails

От 300 000 ₽

Проверка по библиотеке атак: инъекции, jailbreak, утечки, соблюдение системного промпта; отчёт по OWASP LLM Top 10, ретест

2–3 недели

Сопровождение evals

От 1 200 ₽/час

Новые кейсы в датасет, перепрогон при смене модели и промпта, разбор деградаций

Ежемесячно, от 20 часов

На цену влияют: число сценариев ассистента, объём базы знаний под RAG, каналы (чат, голос, почта) и требования к контуру.

Почему дешевле рынка — и почему не в разы. Основной объём evals-проекта — код и датасеты: генерация тестовых наборов, harness прогона, LLM-судья, скрипты атак. Эту часть ИИ ускоряет в разы, и скидка от рыночных смет действует только на неё. Разбор находок, интерпретация результатов и согласование критериев качества с бизнесом делаются руками и считаются по полной ставке. Поэтому проект уровня 300 000 ₽ по рыночным меркам стоит у нас 120 000 ₽, а у сопровождения скидка минимальна.

Граница ответственности

За что отвечаем мы, а за что — вендор модели

В качестве ответов ИИ-системы три слагаемых — модель вендора, ваши данные и промпты, наша методика замера. Границы проговариваем до договора.

  • Модель — зона вендора.
    Тарифы, лимиты, доступность и деградации версий OpenAI, YandexGPT, GigaChat и других — на стороне вендора. Мы измеряем, как его изменения влияют на ваши сценарии.
  • Проценты качества не гарантируем.
    Качество зависит от модели и ваших данных — обещать цифру заранее нельзя. Мы фиксируем измеренное на golden dataset и следим за динамикой от версии к версии.
  • Наступательный red teaming — это пентест.
    Эксплуатация уязвимостей и PoC — отдельная услуга пентеста. Здесь — защитная проверка ИИ-контура по библиотеке атак.
  • Персональные данные в диалогах.
    Работы, требующие лицензий ФСТЭК/ФСБ, и аттестация — у профильных лицензиатов. Привести обработку ПДн к закону поможет защита персональных данных.
  • Дообучение и разработку моделей в услугу не включаем.
    Чинить найденное — промпты, RAG, оркестрацию — умеет наша же команда внедрения ИИ и ИИ-агентов, но это отдельные работы.

Про проценты скажем прямо: если подрядчик обещает конкретный процент правильных ответов, не видя ваших данных, он обещает то, что от него не зависит. Вендор может обновить модель без предупреждения — и метрики изменятся за ночь. Именно поэтому результат нашей работы — не разовая цифра, а регрессионный набор, который ловит такие сдвиги.

Процесс

Как проходит тестирование ИИ

Начинаем с экспресс-оценки: измеренное качество вы видите за 1–2 недели, до входа в большой бюджет.

  1. Разбор сценариев — 3–5 дней.
    Что ассистент должен уметь, где ошибается, какие диалоги реальные. Результат — карта сценариев и план проверки.
  2. Golden dataset и рубрики.
    Собираем эталонные вопросы и ответы из живых диалогов и с вашими экспертами; что считается правильным ответом — решаете вы.
  3. Прогон и разметка.
    LLM-судья оценивает ответы по рубрикам, спорные случаи проверяет человек. Для пакета безопасности здесь же — прогон библиотеки атак.
  4. Разбор находок и отчёт.
    Каждой ошибке — причина: retrieval, промпт, модель или база знаний. Отчёт с приоритетами: что чинить сначала.
  5. Harness в CI и передача.
    Прогон набора в один клик при каждом изменении; датасет, рубрики и код остаются у вас. Дальше — сопровождение по часам.

Подробнее о том, как устроена работа, — на странице этапов реализации.

Почему мы

Почему тестирование ИИ заказывают BUDGET SOFT

Тестировать ИИ должен тот, кто сам его строит: мы разрабатываем ИИ-агентов и RAG-системы — и меряем чужие тем же инструментом, что свои.

Сдаём цифры, а не впечатления

Результат — замер на golden dataset по каждому типу сценариев, до и после правок.

С таким отчётом не спорят — его перепроверяют перепрогоном.

Сами строим ИИ-системы

Evals делает команда, которая разрабатывает ИИ-агентов: знаем, где ломаются RAG и промпты.

Потому что чиним это в собственных проектах — а не только проверяем чужие.

Набор остаётся у вас

Датасет, рубрики и harness — ваши: прогоняете в своём CI без нас и без подписок.

LLM-судью разворачиваем и на вашей модели в закрытом контуре — диалоги не покидают периметр.

230+ проектов за 17 лет

Заказная разработка, интеграции и ИИ-проекты: понимаем и код вокруг модели, и бизнес-критерии качества ответов.

Отрасли

Тестирование ИИ для вашего ассистента

Проверяем ИИ-ассистентов в разных доменах — поддержку клиентов и продажи, RAG по внутренним базам знаний, консультантов в финансах и страховании, медицине и образовании, госсекторе с закрытым контуром.

18 направлений

  • ИТ-компании и Digital-агентства
  • Страховые компании и брокеры
  • МФО и ломбарды
  • Интернет-магазины (e-Commerce)
  • Оптовая торговля и дистрибуция
  • Промышленные предприятия
  • Грузоперевозки и экспедирование
  • Медцентры и клиники общего профиля
  • Стоматология
  • Автодилеры и автосервисы
  • Онлайн-образование (EdTech)
  • Юридические и консалтинговые компании
  • Аренда спецтехники и оборудования
  • Агентства недвижимости
  • Застройщики (девелоперы)
  • Турагентства и Event-индустрия
  • Салоны красоты и бьюти-индустрия
  • Ремонтно-строительные компании
FAQ

Частые вопросы о тестировании ИИ-систем

Сколько стоит тестирование ИИ-системы?

Экспресс-оценка LLM-ассистента — от 60 000 ₽, evals под ключ с регрессионным набором — от 120 000 ₽, проверка безопасности LLM (промпт-инъекции и guardrails) — от 300 000 ₽. Сопровождение evals — от 1 200 ₽ в час, от 20 часов в месяц. Точную смету называем после разбора: цена зависит от числа сценариев, объёма базы знаний и каналов ассистента.

Сколько времени занимает?

Экспресс-оценка — 1–2 недели, evals под ключ — 3–5 недель, проверка безопасности — 2–3 недели. Первые цифры качества вы видите уже на экспресс-оценке, до решения о большом наборе.

Что такое evals и golden dataset простыми словами?

Evals — это «контрольная работа» для ИИ: набор реальных вопросов с известными правильными ответами (golden dataset) и критерии оценки (рубрики). Ассистент прогоняется по набору, и вы получаете долю верных ответов по каждому типу сценариев. Главная ценность — повторяемость: тот же набор прогоняется после каждой правки промпта или смены модели, и сразу видно, стало лучше или хуже.

Вы гарантируете процент правильных ответов?

Нет — и не верьте тем, кто гарантирует. Качество ответов зависит от модели вендора и ваших данных: обещать цифру, не видя их, нельзя. Мы замеряем фактическое качество на golden dataset, фиксируем измеренное в отчёте и отслеживаем динамику от версии к версии. Ошибки при этом не «принимаются как есть»: каждой находим причину и даём план исправления.

Чем это отличается от автоматизации тестирования?

Объектом. Автотесты проверяют обычное ПО — интерфейсы и API, где у каждого действия предсказуемый результат: тест либо прошёл, либо упал. У LLM ответ каждый раз разный, поэтому проверяется он иначе — рубриками на эталонном наборе. Автотесты для вашего продукта — отдельная услуга автоматизации тестирования; обе делает одна команда, поэтому ИИ-часть и обычная часть продукта не повиснут между двумя подрядчиками.

Это то же самое, что red teaming LLM?

Нет. Red teaming — наступательная работа: взлом с эксплуатацией уязвимостей и подтверждением PoC, это профиль нашего пентеста. Пакет «Безопасность LLM» — защитная проверка: прогоняем библиотеку известных атак (инъекции, jailbreak, выведывание промпта и данных), проверяем guardrails и даём отчёт по OWASP LLM Top 10 с ретестом после исправлений.

Работаете с GigaChat и YandexGPT? А качество на русском?

Да, тестируем ассистентов на российских моделях — GigaChat, YandexGPT, локальных open-source — и на зарубежных. Golden dataset собираем на русском языке, на котором говорят ваши клиенты: результаты модели на английских бенчмарках ничего не говорят о её ответах на русском по вашей предметной области. В закрытом контуре разворачиваем и LLM-судью локально — диалоги не покидают периметр.

Вендор обновил модель — и ответы «поплыли». Что делать?

Это штатная ситуация: провайдеры обновляют модели без предупреждения, и поведение ассистента меняется за ночь. Ровно для этого нужен регрессионный набор: перепрогон evals показывает, какие сценарии просели, ещё до жалоб клиентов. В сопровождении держим набор актуальным, прогоняем его при каждом изменении и разбираем деградации.

4×
дешевле разработка
от 2 недель
от идеи до MVP
60+
реализованных проектов
17 лет
опыта в IT
Портфолио

Кейсы, которыми гордимся

Расскажите, что делает ваш ассистент и где он ошибается, — предложим план проверки и назовём цену и срок экспресс-оценки.

Обычно отвечаем в течение рабочего дня.