Миграция с SAP на 1С:ERP
Производственная компания (500+ сотрудников). Поэтапная миграция с SAP ERP на 1С:ERP с кастомными модулями в рамках импортозамещения.
- 0 простоя
- 8 мес миграция
- −40% на лицензиях
Разрабатываем ПО любой сложности для автоматизации бизнеса
Ваш ИИ-ассистент отвечает правильно? Докажем измеримо. Строим evals — регрессионный набор качества для LLM-ассистентов и RAG: прогоняется при каждой смене промпта или модели. Экспресс-оценка — от 60 000 ₽ и 1–2 недель.
Набор реальных сценариев с верными ответами: собираем из живых диалогов, документации и с вашими экспертами.
Это «линейка», которой меряется каждая версия ассистента.
Формальные критерии: фактическая точность, полнота, соответствие тону, отсутствие выдумок.
По рубрикам один и тот же ответ оценивается одинаково — кем бы ни проверялся.
Ответы массово оценивает модель-судья по нашим рубрикам, спорные случаи проверяет человек.
Сходимость оценок судьи и людей контролируем на выборках — судье, который «плывёт», прогон не доверяем.
Harness — код, который прогоняет весь набор в один клик и строит отчёт.
Встраиваем в ваш CI: правка промпта или смена модели без прогона evals не уезжает в прод.

Результат — замер на golden dataset по каждому типу сценариев, до и после правок.
С таким отчётом не спорят — его перепроверяют перепрогоном.

Evals делает команда, которая разрабатывает ИИ-агентов: знаем, где ломаются RAG и промпты.
Потому что чиним это в собственных проектах — а не только проверяем чужие.

Датасет, рубрики и harness — ваши: прогоняете в своём CI без нас и без подписок.
LLM-судью разворачиваем и на вашей модели в закрытом контуре — диалоги не покидают периметр.

Заказная разработка, интеграции и ИИ-проекты: понимаем и код вокруг модели, и бизнес-критерии качества ответов.
Отрасли
Проверяем ИИ-ассистентов в разных доменах — поддержку клиентов и продажи, RAG по внутренним базам знаний, консультантов в финансах и страховании, медицине и образовании, госсекторе с закрытым контуром.
Экспресс-оценка LLM-ассистента — от 60 000 ₽, evals под ключ с регрессионным набором — от 120 000 ₽, проверка безопасности LLM (промпт-инъекции и guardrails) — от 300 000 ₽. Сопровождение evals — от 1 200 ₽ в час, от 20 часов в месяц. Точную смету называем после разбора: цена зависит от числа сценариев, объёма базы знаний и каналов ассистента.
Экспресс-оценка — 1–2 недели, evals под ключ — 3–5 недель, проверка безопасности — 2–3 недели. Первые цифры качества вы видите уже на экспресс-оценке, до решения о большом наборе.
Evals — это «контрольная работа» для ИИ: набор реальных вопросов с известными правильными ответами (golden dataset) и критерии оценки (рубрики). Ассистент прогоняется по набору, и вы получаете долю верных ответов по каждому типу сценариев. Главная ценность — повторяемость: тот же набор прогоняется после каждой правки промпта или смены модели, и сразу видно, стало лучше или хуже.
Нет — и не верьте тем, кто гарантирует. Качество ответов зависит от модели вендора и ваших данных: обещать цифру, не видя их, нельзя. Мы замеряем фактическое качество на golden dataset, фиксируем измеренное в отчёте и отслеживаем динамику от версии к версии. Ошибки при этом не «принимаются как есть»: каждой находим причину и даём план исправления.
Объектом. Автотесты проверяют обычное ПО — интерфейсы и API, где у каждого действия предсказуемый результат: тест либо прошёл, либо упал. У LLM ответ каждый раз разный, поэтому проверяется он иначе — рубриками на эталонном наборе. Автотесты для вашего продукта — отдельная услуга автоматизации тестирования; обе делает одна команда, поэтому ИИ-часть и обычная часть продукта не повиснут между двумя подрядчиками.
Нет. Red teaming — наступательная работа: взлом с эксплуатацией уязвимостей и подтверждением PoC, это профиль нашего пентеста. Пакет «Безопасность LLM» — защитная проверка: прогоняем библиотеку известных атак (инъекции, jailbreak, выведывание промпта и данных), проверяем guardrails и даём отчёт по OWASP LLM Top 10 с ретестом после исправлений.
Да, тестируем ассистентов на российских моделях — GigaChat, YandexGPT, локальных open-source — и на зарубежных. Golden dataset собираем на русском языке, на котором говорят ваши клиенты: результаты модели на английских бенчмарках ничего не говорят о её ответах на русском по вашей предметной области. В закрытом контуре разворачиваем и LLM-судью локально — диалоги не покидают периметр.
Это штатная ситуация: провайдеры обновляют модели без предупреждения, и поведение ассистента меняется за ночь. Ровно для этого нужен регрессионный набор: перепрогон evals показывает, какие сценарии просели, ещё до жалоб клиентов. В сопровождении держим набор актуальным, прогоняем его при каждом изменении и разбираем деградации.
Производственная компания (500+ сотрудников). Поэтапная миграция с SAP ERP на 1С:ERP с кастомными модулями в рамках импортозамещения.
Расскажите, что делает ваш ассистент и где он ошибается, — предложим план проверки и назовём цену и срок экспресс-оценки.
Обычно отвечаем в течение рабочего дня.
Расскажите о задаче — подберём формат и сроки. Обычно отвечаем в течение рабочего дня.