پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

عامل قابل اعتماد از مدل شروع نمی‌شود؛ از harness و مجوز شروع می‌شود

Anthropic در ۹ آوریل ۲۰۲۶ چارچوب «عامل‌های قابل اعتماد در عمل» را منتشر کرد. این منبع از پنجره ترجیحی Batch 1 یعنی ۱۵ آوریل تا ۱۶ اوت قدیمی‌تر است، اما به‌عنوان استثنای مستند حفظ می‌شود، چون اصول آن مستقیماً به امنیت همه عامل‌های دیگر این مجموعه مربوط است. پیا

انتشار: ۱۳ خرداد ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای عامل قابل اعتماد از مدل شروع نمی‌شود؛ از harness و مجوز شروع می‌شود
تصویر رسمی Anthropic؛ منبع تصویر: https://www.anthropic.com/research/trustworthy-agents

عامل قابل اعتماد از مدل شروع نمی‌شود؛ از harness و مجوز شروع می‌شود

Anthropic در ۹ آوریل ۲۰۲۶ چارچوب «عامل‌های قابل اعتماد در عمل» را منتشر کرد. این منبع از پنجره ترجیحی Batch 1 یعنی ۱۵ آوریل تا ۱۶ اوت قدیمی‌تر است، اما به‌عنوان استثنای مستند حفظ می‌شود، چون اصول آن مستقیماً به امنیت همه عامل‌های دیگر این مجموعه مربوط است. پیام مرکزی مقاله این است که رفتار عامل حاصل مدل، harness، ابزار و محیط اجراست؛ مدل خوب در محیط بد هنوز می‌تواند خطرناک باشد.

#عامل چه تفاوتی با chatbot دارد؟

Anthropic عامل را سیستمی تعریف می‌کند که خودش فرایند و استفاده از ابزار را برای رسیدن به هدف هدایت می‌کند. در حلقه‌ای مانند plan، act، observe و adjust، مدل تصمیم می‌گیرد گام بعدی چه باشد و چه زمانی از انسان کمک بخواهد. chatbot بدون ابزار معمولاً پاسخ می‌دهد؛ عامل می‌تواند فایل بخواند، کد اجرا کند، ایمیل بفرستد یا چند سامانه را تغییر دهد.

این اختیار، نقطه تولید ارزش و نقطه ورود ریسک است. اگر intent کاربر مبهم باشد، عامل ممکن است نتیجه‌ای را انتخاب کند که کاربر قصد نداشته است. اگر ابزار بیش از حد باز باشد، یک prompt injection می‌تواند به اقدام واقعی تبدیل شود. پس ارزیابی agent باید «چه کاری می‌تواند انجام دهد» را کنار «در چه محیطی اجازه انجامش دارد» بسنجد.

#پنج اصل عملی

چارچوب Anthropic بر کنترل انسانی، هم‌راستایی با انتظار کاربر، امنیت تعامل، شفافیت و حریم خصوصی تکیه دارد. در Claude.ai و Claude Desktop، permission ابزارها می‌تواند always allow، نیازمند approval یا block باشد. این طراحی به کاربر اجازه می‌دهد خواندن calendar را آزاد بگذارد اما ارسال دعوت‌نامه را نیازمند تأیید کند.

Anthropic می‌گوید در کارهای پیچیده، نرخ check-in خود Claude تقریباً دو برابر می‌شود. این رفتار نشان می‌دهد عامل قابل اعتماد فقط عاملی نیست که کمتر سؤال می‌پرسد؛ باید نقطه‌ای را تشخیص دهد که ادامه دادن بدون تصمیم انسانی خطرناک است. محصول باید این مکث را طبیعی و قابل فهم نمایش دهد.

#دفاع در برابر prompt injection

prompt injection دستور مخربی است که داخل محتوای مورد پردازش پنهان شده؛ یک ایمیل می‌تواند از عامل بخواهد پیام‌های دیگر را برای مهاجم بفرستد. هیچ خط دفاعی منفردی کافی نیست. آموزش مدل، monitor کردن traffic، red team، محدودیت ابزار، محیط جدا و least privilege باید با هم کار کنند.

این مقاله راه‌حل قطعی وعده نمی‌دهد و همین نکته ارزش آن است. سازمان باید قبل از افزودن ابزار، داده قابل دسترسی، permission، مسیر توقف و لاگ را تعیین کند. اعتماد به عامل از جمع تصمیم‌های کوچک معماری ساخته می‌شود، نه از یک برچسب safety روی مدل.

در عمل، این اصول باید به checklist تبدیل شوند: عامل چه فایل‌هایی را می‌بیند، چه اقدامی نیازمند تأیید است، چه چیزی در log ثبت می‌شود و چه کسی در حادثه مسئول توقف است؟ پاسخ‌ها برای یک دستیار تقویم با عامل متصل به مالی یکسان نیستند. سطح اختیار باید با پیامد اقدام متناسب شود.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها
هوش مصنوعی

Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها

OpenAI قابلیت multi-agent را در Responses API به‌صورت beta معرفی کرده است. در این الگو، یک نمونه GPT‑۵.۶ می‌تواند چند زیرعامل را برای بخش‌های مستقل یک مسئله هماهنگ کند و نتیجه‌ها را ترکیب کند. وعده اصلی، کاهش زمان wall-clock و بهتر شدن کارهای پیچیده‌ای است که

۱۸ تیر ۱۴۰۵3 دقیقه