پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

انتشار: ۸ مرداد ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
تصویر رسمی Anthropic؛ منبع تصویر: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف، credential و زمینه واقعی وصل شود، مسیر حمله متفاوتی پیدا کند.

#حادثه چه چیزی به ارزیابی اضافه می‌کند؟

ارزیابی آزمایشگاهی معمولاً task، هدف و شرایط را از قبل مشخص می‌کند. حادثه واقعی زنجیره‌ای ناقص و پر از تصمیم انسانی است: مهاجم چه چیزی را می‌دانسته، کدام ابزار در دسترس بوده، کجا از مدل کمک گرفته و چه گامی توسط انسان انجام شده است. بررسی incident کمک می‌کند تیم بفهمد capability مدل در workflow واقعی چطور ظاهر می‌شود.

Anthropic از داده‌های رخداد برای مقایسه روش‌های استفاده و بهبود cyber evaluations بهره می‌گیرد. این رویکرد به معنای نسبت دادن هر حمله به مدل نیست. ابزارهای عمومی، اپراتور انسانی و ضعف سیستم هدف نیز نقش دارند. تحلیل دقیق باید سهم مدل را از سهم harness و محیط جدا کند.

#مدل، کاربر و محیط

یک مدل می‌تواند در پیدا کردن آسیب‌پذیری از exploit کردن آن بهتر باشد. همچنین ممکن است در نوشتن اسکریپت کمک کند اما در حمله end-to-end به مانع شبکه یا نیاز به credential برسد. این تفاوت‌ها برای سیاست دسترسی مهم‌اند. «توانایی سایبری بالا» لزوماً به معنی امکان حمله مستقل در همه شبکه‌ها نیست، اما به معنی بی‌خطر بودن هم نیست.

عامل امنیتی باید در محیطی قرار گیرد که دامنه فایل، شبکه و execution محدود باشد. هر call ابزار باید log شود و خروجی مشکوک به مرحله بررسی انسانی برود. اگر مدل از دفاع‌کننده برای اسکن شبکه استفاده می‌کند، مالکیت هدف و مجوز آزمون باید قبل از شروع روشن باشد.

#پیام ارزیابی

سه incident نشان می‌دهد benchmark باید به‌صورت چرخه‌ای به‌روز شود. وقتی مهاجم روش تازه‌ای پیدا می‌کند، سناریوی ارزیابی باید آن را بازنمایی کند؛ وقتی safeguard جدید می‌آید، باید هم موفقیت دفاع و هم مسیر دور زدن آن اندازه‌گیری شود. نتیجه یک عدد ثابت برای همیشه نیست.

برای مدیر امنیت، ارزش چنین پژوهشی در تغییر سؤال است: به‌جای «مدل چند امتیاز گرفت؟» بپرسید «در کدام محیط و با کدام مجوز می‌تواند چه زنجیره‌ای را کامل کند؟» امنیت عامل ترکیبی از مدل، ابزار، اپراتور، مانیتورینگ و واکنش به حادثه است.

سازمان باید پس از هر رخداد، فقط prompt را اصلاح نکند. دسترسی، ترتیب ابزار، alert، مسیر escalation و آموزش اپراتور نیز باید بازبینی شوند. اگر یک کنترل فقط در شرایط آزمایش کار کند و در production دیده نشود، incident بعدی همان شکاف را با هزینه واقعی آشکار خواهد کرد.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی
هوش مصنوعی

سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی

سیستم‌کارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، به‌جای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال می‌کند. GPT‑۵.۶ خانواده‌ای از Sol، Terra و Luna است و در ارزیابی‌های OpenAI در امنیت سایبری و زیست‌شناسی در سطح High capability قر

۱۸ تیر ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه