واترمارک متنی Claude؛ نشانهگذاری آماری بهجای ادعای تشخیص قطعی
Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر میده

واترمارک متنی Claude؛ نشانهگذاری آماری بهجای ادعای تشخیص قطعی
Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر میدهد متفاوت است؛ متن باید همچنان طبیعی بماند و نشانه در توزیع انتخاب واژهها پنهان شود.
#detector چه چیزی را میسنجد؟
ابزار تشخیص به دنبال یک الگوی احتمالی میگردد، نه جملهای مخفی یا کدی در متن. اگر متن طول کافی داشته باشد و با ویرایش سنگین، ترجمه یا بازنویسی تغییر نکرده باشد، احتمال شناسایی بیشتر است. در متنهای کوتاه، نتیجه آماری ضعیفتر است. بنابراین خروجی detector باید به شکل confidence گزارش شود و نه حکم دوگانه «AI/انسان».
این تمایز برای دانشگاه و رسانه اهمیت دارد. یک متن انسانی که بعداً توسط مدل ویرایش شده، ممکن است نشانهای از Claude داشته باشد؛ متنی که از Claude گرفته و چند بار بازنویسی شده، ممکن است دیگر قابل شناسایی نباشد. تشخیص منشأ و تشخیص کیفیت یا تقلب علمی دو مسئله جدا هستند و نباید با یک شاخص حل شوند.
#چرا روش آماری شکننده است؟
مترجم، ویراستار و مدل زبانی دیگر میتوانند توزیع واژهها را تغییر دهند. همچنین نقلقول، کد، فهرست و زبانهایی با منابع کوچک رفتار آماری متفاوتی دارند. Anthropic محدودیتهای چنین سامانهای را بخشی از توضیح خود میداند؛ واترمارک به اندازهای مفید است که زنجیره پردازش متن آن را حفظ کند.
برای ارائهدهنده محتوا، ثبت provenance کنار detector مهم است. اگر متن از یک مدل به CMS رسید، سپس توسط ویراستار اصلاح و در چند کانال منتشر شد، هر مرحله باید جداگانه ثبت شود. نگهداشتن فقط نتیجه نهایی detector، امکان توضیح تصمیم را از بین میبرد.
#کاربرد مسئولانه
واترمارک میتواند برای triage استفاده شود: سامانه محتوای مشکوک را برای بررسی انسانی جلو بیاورد، یا منشأ احتمالی یک گزارش را در آرشیو نشان دهد. اما نباید بهتنهایی مبنای رد درخواست استخدام، نمره دانشجو یا حذف خبر باشد. نرخ خطای مثبت و منفی باید روی دادههای واقعی سازمان اندازهگیری شود.
ارزش این کار بیشتر در ایجاد سیگنال provenance است تا وعده کشف همه متنهای مصنوعی. Anthropic مسئلهای دشوار را قابل بررسیتر میکند؛ مسئولیت تفسیر محتاطانه همچنان با سازمانی است که detector را در workflow خود قرار میدهد.
برای انتشار فارسی، طول متن و مرحله ترجمه باید در ارزیابی جداگانه ثبت شود. نتیجه detector روی متن انگلیسی ممکن است پس از ترجمه تغییر کند و نباید به نسخه ترجمهشده منتقل شود. سیاست درست، ثبت متن اولیه، ابزارهای ویرایش و نتیجه هر مرحله است تا خواننده بداند «احتمال منشأ» به کدام نسخه مربوط بوده است.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابیهای امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترلشده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

سیستمکارت GPT‑۵.۶؛ رشد توان عاملی و آزمونهای سختتر ایمنی
سیستمکارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، بهجای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال میکند. GPT‑۵.۶ خانوادهای از Sol، Terra و Luna است و در ارزیابیهای OpenAI در امنیت سایبری و زیستشناسی در سطح High capability قر

GPT-۵.۶ ارزانتر شد؛ Fast Mode برای کدام بار کاری است؟
اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادیتر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریعتر برای