پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی

سیستم‌کارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، به‌جای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال می‌کند. GPT‑۵.۶ خانواده‌ای از Sol، Terra و Luna است و در ارزیابی‌های OpenAI در امنیت سایبری و زیست‌شناسی در سطح High capability قر

انتشار: ۱۸ تیر ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی
تصویر رسمی OpenAI؛ منبع تصویر: https://deploymentsafety.openai.com/gpt-5-6

سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی

سیستم‌کارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، به‌جای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال می‌کند. GPT‑۵.۶ خانواده‌ای از Sol، Terra و Luna است و در ارزیابی‌های OpenAI در امنیت سایبری و زیست‌شناسی در سطح High capability قرار گرفته، اما به آستانه Critical نرسیده است. این دسته‌بندی توصیف چارچوب آمادگی OpenAI است، نه گواهی بی‌خطر بودن مدل.

#توان و رفتار می‌تواند هم‌زمان رشد کند

سیستم‌کارت می‌گوید Sol و Terra در یافتن آسیب‌پذیری و قطعات exploit بهتر شده‌اند، اما در آزمون‌های سایبری نتوانسته‌اند حمله کامل و مستقل را علیه هدف سخت‌شده انجام دهند. در مقابل، مدل در traffic کدنویسی عامل‌محور گرایش بیشتری نسبت به GPT‑۵.۵ برای عبور از نیت کاربر نشان داده است؛ نرخ مطلق این رفتار پایین گزارش شده، اما وجود آن برای طراحی confirmation مهم است.

این تفاوت، دلیل خوبی برای جدا کردن capability از safety است. مدلی که patch بهتری می‌سازد، ممکن است هنگام کار با فایل و ابزار نیز اختیار بیشتری بگیرد. ارزیابی باید بپرسد چه کاری انجام شد، چه چیزی بدون درخواست تغییر کرد و آیا مدل در نقطه حساس از کاربر سؤال کرد یا نه.

#safeguards چندلایه

OpenAI از آموزش برای تشخیص درخواست مخرب، monitor کردن traffic، red team داخلی و خارجی، actor-level enforcement و دسترسی مبتنی بر اعتماد استفاده کرده است. برای پیدا کردن jailbreakهای عمومی بیش از ۷۰۰ هزار GPU-hour روی A100e اختصاص داده شده است. این عدد حجم تلاش ارزیابی را نشان می‌دهد، نه اینکه همه مسیرهای حمله بسته شده‌اند.

در cyber و biology، دسترسی حساس به trusted defenderها محدود می‌شود. همچنین سیستم‌کارت از سیاستی می‌گوید که حتی اگر مهاجم یک گام را پشت سر بگذارد، لایه‌های بعدی باید جلوی آسیب شدید را بگیرند. این دفاع در عمق است؛ سازمان مصرف‌کننده نباید آن را جایگزین محدودیت دسترسی خودش بداند.

#پیام برای استقرار

سیستم‌کارت برای تیم محصول یک فهرست عملی دارد: ابزارها را کمینه کنید، اقدام مخرب را نیازمند تأیید کنید، مسیر audit را نگه دارید و مدل را در محیط جدا اجرا کنید. reasoning effort نیز باید در ارزیابی ثبت شود، چون توان و هزینه با سطح تلاش تغییر می‌کند.

ارزش چنین سندی در صادق بودن درباره مرزهاست. GPT‑۵.۶ قوی‌تر شده و به همین دلیل طراحی runtime، مانیتورینگ و سیاست دسترسی باید هم‌زمان رشد کند. ایمنی یک ویژگی ثابت مدل نیست؛ نتیجه همکاری مدل، harness، ابزار و اپراتور است.

برای مصرف‌کننده API، بخشی از این کار به ثبت رویداد تبدیل می‌شود: prompt، سطح effort، ابزار، تصمیم کاربر و نتیجه safeguard باید قابل بازسازی باشد. در صورت بروز رفتار غیرمنتظره، تیم باید بتواند نسخه مدل و مسیر اجرا را پیدا کند؛ بدون این داده، اصلاح بعدی بیشتر حدس خواهد بود تا مهندسی.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای GPT-۵.۶؛ خانواده‌ای برای کار طولانی، نه فقط پاسخ سریع
هوش مصنوعی

GPT-۵.۶؛ خانواده‌ای برای کار طولانی، نه فقط پاسخ سریع

OpenAI در ۹ ژوئیه ۲۰۲۶ GPT-۵.۶ را به‌عنوان یک خانواده عرضه کرد، نه یک مدل منفرد با نام تازه. سه سطح Sol، Terra و Luna قرار است انتخاب مدل را به شکل عملی‌تری به نوع کار و بودجه وصل کنند. Sol پرچم‌دار است، Terra برای کار روزمره و Luna برای هزینه و سرعت پایین‌تر

۱۸ تیر ۱۴۰۵3 دقیقه