InquirerPalace to Pia Cayetano on fear for her liberty: Is this paranoia? Don’t panicESPNCavaliers promote Weems to take over GM roleRTP DesportoUEFA e CONCACAF pedem dados à FIFA sobre projeto de privatizar MundiaisESPN Deportes¿Con un Joel Embiid saludable, los 76ers son imparables?Daily MaverickAGE OF ACCOUNTABILITY: Five criminal cases later, Ekurhuleni fires Julius MkhwanaziThe Jerusalem PostSaudi Aramco suspends European crude deliveries after East-West pipeline attack - reportוואלהבן 30 נפל מסוס באום אל פחם: מצבו קשהComplete Sports‘He Has To Go’ –Germany FA Tells InfantinoGlobal NewsOttawa mayoral candidate charged for alleged death threats against Sutcliffe, FordNOSAmerikaanse sancties raken vooral middenstand Iran: 'Geen mens kan dit volhouden'الشرقمعارك شمال كردفان.. الجيش السوداني يوسع انتشاره حول سودريWirtualna PolskaSypią się donosy. Kto w Polsce donosi najczęściej?
The Daily Newsstand · Free, Always
Friday, September 18, 2026

Внедрение «водяных знаков» может сделать поведение ИИ-моделей непредсказуемым

Translate

логотип 3DNews

Опрос

реклама

Новости Software

Самое интересное в обзорах

18.09.2026 [16:54],

Использование «водяных знаков», то есть маркировки генерируемого контента, может оказать влияние на поведение больших языковых моделей искусственного интеллекта. К такому выводу пришли эксперты компании Lasso, проведя анализ технологии SynthID-Text лаборатории Google DeepMind.

Источник изображения: lasso.security

Источник изображения: lasso.security

Маркировка SynthID-Text влияет на такие аспекты работы модели как её готовность отклонять вредоносные запросы, уязвимость к атакам типа «инъекция запроса», выбор инструментов ИИ-агентами и многое другое. Технология SynthID-Text и аналогичные ей методы маркировки предназначаются для внедрения машиночитаемого индикатора, позволяющего определить, был ли текст сгенерирован ИИ или написан человеком; в действительности же процедура внедрения маркировки может оказать влияние на то, что отвечает ИИ-модель, и на то, что делает ИИ-агент.

Даже без целенаправленной атаки маркировка может менять решение модели об отказе в ответе. В некоторых протестированных моделях это выражалось в большей готовности выполнять потенциально вредоносные запросы, причём при использовании prompt injection различия между маркированной и немаркированной генерацией становились заметнее. При этом эффект зависел от конкретной модели и ключа водяного знака

Ранее в ЕС вступили в силу требования об обязательной маркировке генерируемого ИИ контента, а Anthropic изъявила намерение ввести её для всех типов материалов, включая текстовые. То есть можно ожидать, что практика маркировки ИИ-контента станет массовой среди прочих разработчиков, и это указывает на потенциальный новый источник изменений поведения ИИ-систем, который разработчикам агентов следует учитывать при оценке безопасности

Эксперты Lasso призывают разработчиков не просто развёртывать средства маркировки генерируемых ИИ материалов, но и проводить повторный бенчмаркинг моделей, проверку их безопасности и другие тесты для выявления непредвиденных последствий. Исследование, однако, не следует воспринимать как довод против использования маркировки контента ИИ, оговорились в компании.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.

View the original on 3DNews

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.