Компания BSS анонсировала выход версии 3.8 инструментария NLU-Suite. Ключевым нововведением стал функционал оценок...
16 Июля 2026 17:49 16 Июл 2026 17:49 |
Компания BSS анонсировала выход версии 3.8 инструментария NLU-Suite. Ключевым нововведением стал функционал оценок GAI, позволяющий использовать большие языковые модели (LLM) в роли аудитора для автоматизированного тестирования ответов RAG-систем (Retrieval-Augmented Generation). Это один из самых востребованных сегодня подходов к построению корпоративных ИИ-приложений. Об этом CNews сообщили представители BSS.
NLU-Suite представляет собой инструментарий для обучения моделей распознавания через визуальный интерфейс. Система позволяет с высокой точностью выявлять намерения клиента в диалоге и извлекать ключевые атрибуты (слоты) из речи: числа, локации, даты и прочие специфические сущности. С массовым внедрением генеративного ИИ перед бизнесом встала новая проблема: контроль фактологической точности и безопасности ответов. В новой версии решение выходит за рамки традиционного NLU, предоставляя комплексные средства для оценки качества работы генеративных моделей.
Обновленный модуль «Метрики» и раздел «Оценка» поддерживают гибкую настройку контрольных точек. Дата-инженеры и аналитики могут использовать три типа метрик: Рубрики — с фиксированными критериями, весовыми коэффициентами и настраиваемыми шкалами (от непрерывных значений до текстовых меток); Категории — для классификации ответа по заданным параметрам качества; Попарное сравнение — для A/B-тестирования ответов на базе одного набора данных, но сгенерированных разными LLM.
В релиз уже включены предустановленные отраслевые метрики для RAG-систем. Среди них: Answer_Correctness (сравнение с эталоном), Answer_Correctness_noRef (оценка качества без опоры на эталон), Context_Relevancy (оценка того, насколько точно ИИ подобрал релевантные чанки из базы знаний) и Faithfulness (проверка на отсутствие «галлюцинаций» и противоречий предоставленным документам).
Что нужно для автоматизации обслуживания зданий в госсекторе Бизнес
«Главный вызов для бизнеса сегодня — это не просто внедрение генеративного ИИ, а обеспечение его предсказуемости и фактологической точности, особенно в клиентском сервисе. В версии 3.8 мы реализовали функционал, который позволяет автоматизировать один из самых трудоёмких этапов разработки RAG-систем — валидацию качества ответов. Использование LLM в роли аудитора даёт возможность оценивать ответы по множеству критериев одновременно, включая фактологическую точность и релевантность контекста, без необходимости ручного анализа каждого кейса. Это существенно ускоряет вывод голосовых помощников и чат-ботов в промышленную эксплуатацию», — сказал Александр Крушинский, директор департамента голосовых цифровых технологий компании BSS.
Другие материалы рубрики
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | BSS превращает чат-платформу в интеллектуальный центр управления диалогами: релиз 2.5 с RAG и кобраузингом | 5 | 7 | 03-07-2026 |
| 2 | BSS превращает чат-платформу в интеллектуальный центр управления диалогами: релиз 2.5 с RAG и кобраузингом | 5 | 7 | 03-07-2026 |
| 3 | Запущено новое решение ML Sense для контроля качества теплоизоляционных материалов | 0 | 5.18 | 14-08-2026 |
| 4 | «К2 НейроТех» запустила калькулятор ИИ-зрелости для оценки инфраструктурной готовности бизнеса | 0 | 5 | 16-07-2026 |
| 5 | Nord Clan выпустила новый продукт «ML Sense Контроль фракций» | 0 | 4.65 | 21-08-2026 |
| 6 | Nord Clan выпустила новый продукт «ML Sense Контроль фракций» | 0 | 4.65 | 21-08-2026 |
| 7 | Х5 запустила полный цикл оценки продуктовых компетенций с помощью ИИ | 5 | 7 | 02-07-2026 |
| 8 | Х5 запустила полный цикл оценки продуктовых компетенций с помощью ИИ | 5 | 7 | 02-07-2026 |
| 9 | MWS AI выпустила бенчмарк для оценки качества мультимодальных моделей, работающих с документами на русском языке | 0 | 7 | 10-10-2025 |
| 10 | В России появился первый ИИ-пентестер | 0 | 7 | 07-07-2026 |