В гонке ИИ-фильтров появился неожиданный участник
ИИ-фильтры — это сложная и критически важная задача, и недавно Red Hat протестировала девять различных подходов. Их команда по безопасности ИИ провела бенчмаркинг решений для обнаружения prompt injection и проверки безопасности контента, включая признанные LLM-судьи, специализированные классификаторы и новую волну «моделей принятия решений». Это тщательное сравнение было нацелено на то, чтобы отделить маркетинговый хайп от реальной производительности.
Модель принятия решений Jev от TypeSafe вступила в борьбу с убедительным аргументом: это zero-shot модель, которая возвращает структурированные решения вместо текста. Такая архитектура обещает качество суждений на уровне большой языковой модели, но с существенно меньшими задержками и затратами. Дизайн Jev позволяет избежать авторегрессионной генерации, характерной для традиционных LLM, что делает вывод более быстрым и предсказуемым.
Бенчмарк Red Hat поставил фундаментальный вопрос: может ли новая, специально разработанная архитектура, такая как Jev, действительно превзойти широкий спектр признанных инструментов? В линейку вошли:
- Крупные LLM-судьи (Qwen 3.6 35B, NVIDIA Nemotron)
- Предобученные классификаторы (Red Hat DeBERTa-v3-base)
- Open-source модели принятия решений (Laya, DiffusionGemma)
Тест должен был показать, сможет ли Jev выполнить свое обещание по обеспечению превосходной эффективности и точности в критических задачах безопасности, или же существующие методы все еще сохраняют преимущество. Результаты должны были выявить, трансформируются ли инновации в архитектуре моделей напрямую в практические преимущества для безопасности ИИ.
Модель размером с ноутбук почти догнала гиганта
Результаты Red Hat по обнаружению prompt injection удивили многих. Qwen, LLM с 35 миллиардами параметров, лидировала с точностью 89,31%. Однако кастомный классификатор DeBERTa от Red Hat, имеющий около 200 миллионов параметров, достиг почти идентичной точности в 89,01%. Это разница всего в 0,3 процентных пункта по сравнению с моделью, которая более чем в 100 раз больше по размеру.
Jev, широко разрекламированная модель принятия решений, заняла четвертое место в тесте на prompt injection с результатом 86,35%. Ее медианная задержка составила около 348 миллисекунд на запрос, хотя путь вызова из Великобритании в США добавил около 56 миллисекунд сетевых задержек. Модель DeBERTa, работающая локально на процессоре MacBook, завершала свои выводы примерно за 54 миллисекунды.
Этот резкий контраст в производительности и задержках подчеркивает важный практический вывод. Для четко определенных задач при наличии размеченных данных небольшой специализированный классификатор может обеспечить высокую точность. Такие модели обладают значительным преимуществом в виде локального вывода с низкой задержкой, доказывая, что вычислительные гиганты не всегда необходимы для эффективных AI guardrails.
Jev побеждает в одном тесте — и раскрывает ловушку с промптами
Jev, модель принятия решений, нашла свою нишу в безопасности контента, возглавив список с точностью 86,20%. Это превзошло показатели DiffusionGemma (85,53%) и Qwen (85,47%). Меньшая модель Granite Guardian от Red Hat отстала с результатом 80,27%, что продемонстрировало силу Jev в нюансированной оценке политик.
Команда Red Hat сделала важное открытие в области промпт-инжиниринга. Laya, open-source модель принятия решений, изначально показала удручающие 58% в тесте на безопасность контента. После переписывания промпта производительность Laya выросла почти на 18 процентных пунктов.
Этот успех, однако, выявил проблему с промптами. Применение оптимизированного промпта Laya к Jev на самом деле снизило оценку Jev. Это подчеркивает, что даже сложные zero-shot модели принятия решений требуют тестирования и настройки промптов для каждой конкретной модели. Подробнее о методологии тестирования см. в статье Benchmarking AI decision models against traditional guardrails - Red Hat Developer. Это подтверждает необходимость тщательного, индивидуального prompt engineering, а не предположения о том, что промпты будут одинаково эффективны для разных моделей.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
Выбирайте инструмент под задачу, а не под маркетинговые обещания
Оценка Red Hat позволила ответить на критически важный вопрос: decision models не дают стабильного преимущества. В ходе тестов они не были надежно быстрее, дешевле или точнее, чем обычные LLM-судьи или специализированные классификаторы. Этот вывод ставит под сомнение шумиху вокруг «System 1» в индустрии.
На практике выбирайте инструмент в зависимости от требований политики. Небольшой классификатор, такой как DeBERTa от Red Hat с 200 млн параметров, отлично подходит для стабильных, хорошо размеченных задач с большим объемом данных, обеспечивая задержку менее 60 мс. Рассмотрите возможность использования decision model, такой как Jev, когда политики широки или размеченных примеров недостаточно.
Более глубокий инженерный урок ясен: тестируйте реальную задачу, а не теоретическую производительность. Учитывайте end-to-end network latency, которая добавила 56 мс к трансатлантическим вызовам Jev. Кроме того, проверяйте промпты для каждой модели; даже zero-shot decision models требуют настройки, и промпт, оптимизированный для одной архитектуры, может снизить производительность другой. Стремление к «zero-shot» не должно затмевать реальность prompt engineering.
Часто задаваемые вопросы
Что такое Jev?
Jev — это zero-shot decision model, разработанная для возврата структурированных классификаций вместо генерации свободного текста.
Как Jev показал себя в бенчмарке Red Hat?
Jev набрал 86,35% в обнаружении prompt injection и стал лидером в тесте на безопасность контента с результатом 86,20%.
Какая модель почти сравнялась с Qwen в обнаружении prompt injection?
Классификатор DeBERTa от Red Hat с примерно 200 миллионами параметров набрал 89,01%, что близко к результату Qwen в 89,31%.
Всегда ли decision models быстрее или дешевле, чем LLM-судьи?
Нет. Red Hat не обнаружила надежного преимущества во всех случаях; задержка, стоимость и точность варьировались в зависимости от задачи и настроек.

