پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی

برچسب

#ارزیابی

صفحه‌های برچسب برای مرور رابطه‌ی میان مقاله‌های منتشرشده ساخته شده‌اند و در این فاز noindex باقی می‌مانند.

3 مقاله منتشرشده
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی
هوش مصنوعی

سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی

سیستم‌کارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، به‌جای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال می‌کند. GPT‑۵.۶ خانواده‌ای از Sol، Terra و Luna است و در ارزیابی‌های OpenAI در امنیت سایبری و زیست‌شناسی در سطح High capability قر

۱۸ تیر ۱۴۰۵3 دقیقه
تصویر رسمی GitHub برای هارنس Copilot؛ لایه‌ای که مدل را به عامل کدنویسی تبدیل می‌کند
هوش مصنوعی

هارنس Copilot؛ لایه‌ای که مدل را به عامل کدنویسی تبدیل می‌کند

در ارزیابی ۲۵ ژوئن ۲۰۲۶، GitHub یک نکته معماری را برجسته کرد: مدل خام فقط بخشی از توانایی عامل کدنویسی است. هارنس Copilot ابزارها، زمینه و workflow را هماهنگ می‌کند و در Copilot CLI، اپلیکیشن، code review و SDK مشترک است. اگر این لایه بهتر شود، چند سطح محصول م

۴ تیر ۱۴۰۵3 دقیقه