Anthropic розкрила секрети водяних знаків у текстах Claude

Anthropic впроваджує “цифрове тавро”: Як Claude позначатиме створений ШІ контент
Компанія Anthropic деталізувала механізм впровадження системи прихованих водяних знаків для контенту, згенерованого її мовною моделлю Claude. За заявами розробників, ця технологія жодним чином не впливатиме на якість або сприйняття текстів звичайним користувачем, проте спеціалізовані інструменти зможуть виявляти їхню “штучну” природу.
Ініціатива Anthropic зумовлена виконанням вимог нового Кодексу прозорості ЄС щодо штучного інтелекту. Цей документ зобов’язує розробників впроваджувати технології, що дозволяють ідентифікувати контент, створений ШІ.
Технологічні деталі впровадження
Для реалізації задуму Anthropic використовуватиме підхід SynthID-Text, презентований командою Google DeepMind у 2024 році. Компанія також планує надати API-інтерфейс, що дасть змогу стороннім розробникам перевіряти тексти на наявність прихованого маркування.
Принцип роботи водяних знаків ґрунтується на певних закономірностях у тексті. Наприклад, коли Claude має вибір між синонімічними словами, система може використовувати ці “низькоризикові” рішення для формування непомітного шаблону. Візуально текст, позначений таким чином, нічим не відрізнятиметься від звичайного.
Обмеження та можливості редагування
Важливою особливістю є можливість часткового або повного видалення водяного знака шляхом редагування. Проте, Anthropic стверджує, що незначні правки, найімовірніше, не зможуть повністю усунути маркування. Лише повне переписування тексту зі зміною практично кожного слова дозволить позбутися “цифрового тавра”.
У ситуаціях, коли Claude лише незначно редагує текст, написаний людиною, виявити водяний знак стає складніше. Компанія пояснює це тим, що в такому разі більшість слів залишаються оригінальними, і системі бракує елементів для накладання маркування.
Щодо програмного коду, то водяний знак буде менш вираженим. Це пояснюється обмеженістю вибору модельних рішень під час написання коду. Однак, маркування може застосовуватися до елементів, таких як коментарі.
Реакція спільноти та майбутні перспективи
Anthropic зазначає, що Claude не буде єдиним ШІ-чатботом із подібними функціями. Інші провідні розробники мовних моделей, які підписали відповідний Кодекс практики ЄС, також планують запроваджувати власні системи маркування.
Варто зазначити, що ця нововведення викликало неоднозначну реакцію користувачів. Деякі учасники обговорень на Reddit висловили занепокоєння щодо можливого стеження та необґрунтованих підозр. Інші розглядають таке маркування як прояв лицемірства, особливо з огляду на те, що сам Claude використовує технології, розроблені іншими компаніями.
Порада від Business News:
Інформація про впровадження водяних знаків у текстах Claude є важливою для всіх, хто працює з контентом, створеним штучним інтелектом, або використовує подібні інструменти. Розуміння того, як саме ідентифікуватиметься ШІ-згенерований контент, допоможе уникнути непорозумінь, забезпечити прозорість у використанні технологій та відповідати новим регуляторним вимогам, зокрема європейським.
За даними порталу: mezha.ua
