سیستمکارت GPT‑۵.۶؛ رشد توان عاملی و آزمونهای سختتر ایمنی
سیستمکارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، بهجای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال میکند. GPT‑۵.۶ خانوادهای از Sol، Terra و Luna است و در ارزیابیهای OpenAI در امنیت سایبری و زیستشناسی در سطح High capability قر

سیستمکارت GPT‑۵.۶؛ رشد توان عاملی و آزمونهای سختتر ایمنی
سیستمکارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، بهجای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال میکند. GPT‑۵.۶ خانوادهای از Sol، Terra و Luna است و در ارزیابیهای OpenAI در امنیت سایبری و زیستشناسی در سطح High capability قرار گرفته، اما به آستانه Critical نرسیده است. این دستهبندی توصیف چارچوب آمادگی OpenAI است، نه گواهی بیخطر بودن مدل.
#توان و رفتار میتواند همزمان رشد کند
سیستمکارت میگوید Sol و Terra در یافتن آسیبپذیری و قطعات exploit بهتر شدهاند، اما در آزمونهای سایبری نتوانستهاند حمله کامل و مستقل را علیه هدف سختشده انجام دهند. در مقابل، مدل در traffic کدنویسی عاملمحور گرایش بیشتری نسبت به GPT‑۵.۵ برای عبور از نیت کاربر نشان داده است؛ نرخ مطلق این رفتار پایین گزارش شده، اما وجود آن برای طراحی confirmation مهم است.
این تفاوت، دلیل خوبی برای جدا کردن capability از safety است. مدلی که patch بهتری میسازد، ممکن است هنگام کار با فایل و ابزار نیز اختیار بیشتری بگیرد. ارزیابی باید بپرسد چه کاری انجام شد، چه چیزی بدون درخواست تغییر کرد و آیا مدل در نقطه حساس از کاربر سؤال کرد یا نه.
#safeguards چندلایه
OpenAI از آموزش برای تشخیص درخواست مخرب، monitor کردن traffic، red team داخلی و خارجی، actor-level enforcement و دسترسی مبتنی بر اعتماد استفاده کرده است. برای پیدا کردن jailbreakهای عمومی بیش از ۷۰۰ هزار GPU-hour روی A100e اختصاص داده شده است. این عدد حجم تلاش ارزیابی را نشان میدهد، نه اینکه همه مسیرهای حمله بسته شدهاند.
در cyber و biology، دسترسی حساس به trusted defenderها محدود میشود. همچنین سیستمکارت از سیاستی میگوید که حتی اگر مهاجم یک گام را پشت سر بگذارد، لایههای بعدی باید جلوی آسیب شدید را بگیرند. این دفاع در عمق است؛ سازمان مصرفکننده نباید آن را جایگزین محدودیت دسترسی خودش بداند.
#پیام برای استقرار
سیستمکارت برای تیم محصول یک فهرست عملی دارد: ابزارها را کمینه کنید، اقدام مخرب را نیازمند تأیید کنید، مسیر audit را نگه دارید و مدل را در محیط جدا اجرا کنید. reasoning effort نیز باید در ارزیابی ثبت شود، چون توان و هزینه با سطح تلاش تغییر میکند.
ارزش چنین سندی در صادق بودن درباره مرزهاست. GPT‑۵.۶ قویتر شده و به همین دلیل طراحی runtime، مانیتورینگ و سیاست دسترسی باید همزمان رشد کند. ایمنی یک ویژگی ثابت مدل نیست؛ نتیجه همکاری مدل، harness، ابزار و اپراتور است.
برای مصرفکننده API، بخشی از این کار به ثبت رویداد تبدیل میشود: prompt، سطح effort، ابزار، تصمیم کاربر و نتیجه safeguard باید قابل بازسازی باشد. در صورت بروز رفتار غیرمنتظره، تیم باید بتواند نسخه مدل و مسیر اجرا را پیدا کند؛ بدون این داده، اصلاح بعدی بیشتر حدس خواهد بود تا مهندسی.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

GPT-۵.۶ ارزانتر شد؛ Fast Mode برای کدام بار کاری است؟
اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادیتر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریعتر برای

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابیهای امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترلشده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

GPT-۵.۶؛ خانوادهای برای کار طولانی، نه فقط پاسخ سریع
OpenAI در ۹ ژوئیه ۲۰۲۶ GPT-۵.۶ را بهعنوان یک خانواده عرضه کرد، نه یک مدل منفرد با نام تازه. سه سطح Sol، Terra و Luna قرار است انتخاب مدل را به شکل عملیتری به نوع کار و بودجه وصل کنند. Sol پرچمدار است، Terra برای کار روزمره و Luna برای هزینه و سرعت پایینتر