AI

Mistral выпустила Shieldstral — модель для модерации текста и изображений с открытыми весами

Mistral выпустила Shieldstral — модель для модерации текста и изображений с открытыми весами

Mistral представила Shieldstral — мультимодальную модель с 3 млрд параметров для проверки безопасности текста и изображений. Модель получает политику модерации в виде вопроса на естественном языке и оценивает вероятность ответов «да» и «нет». Фиксированный список категорий для этого не нужен.

Mistral опубликовала веса Shieldstral по лицензии Apache 2.0. По данным компании, для работы модели достаточно одной видеокарты NVIDIA с 16 ГБ памяти. При этом Shieldstral показывает результаты на уровне открытых защитных моделей, которые до семи раз крупнее. Подробнее в материале Postium.

Читайте также: ТОП-20 ии-агентов для работы

Shieldstral — как работает модель

Запрос для состоит из трёх частей: инструкции с ом и строгостью проверки, вопроса о нарушении политики и самого материала. На проверку можно отправить промпт, ответ модели, пару «промпт — ответ», отдельное изображение или изображение с сопровождающим текстом.

Shieldstral обрабатывает запрос как вопрос с двумя вариантами ответа и выдаёт один токен — «да» или «нет». Программная обвязка извлекает вероятности обоих вариантов, нормализует их и получает непрерывный балл. Он показывает, насколько модель уверена в ответе «да».

В одном формате Shieldstral классифицирует промпты, проверяет ответы, распознаёт отказы модели и оценивает токсичность текста или изображения.

Mistral проверила Shieldstral по четырём направлениям: безопасность текста, распознавание отказов, адаптация к новой политике и мультимодальная модерация. Результаты компания приводит в техническом отчёте.

Чтобы скачать и установить Shieldstral, откройте страницу модели на сайте Mistral и перейдите по ссылке для загрузки открытых весов. Запустить модель можно через vLLM, llama.cpp, SGLang или Transformers.

Mistral выпустила Shieldstral — модель для модерации текста и изображений с открытыми весами

Mistral выпустила Shieldstral — модель для модерации текста и изображений с открытыми весами

Почему это важно? Защитные модели часто обучают на заранее заданной таксономии рисков. В случае со Shieldstral правило указывают прямо в запросе. Сервис или команда могут менять формулировку политики под конкретную проверку без переобучения отдельного классификатора.

Итог: Shieldstral проверяет текст и изображения по правилам, которые указаны в запросе. Веса модели доступны по открытой лицензии.

Источник

Добавить комментарий

Кнопка «Наверх»