پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

Claude Sonnet ۵؛ عامل‌محوری ارزان‌تر با کنترل سطح تلاش

Anthropic در ۳۰ ژوئن ۲۰۲۶ Claude Sonnet ۵ را عرضه کرد و آن را عامل‌محورترین مدل Sonnet نامید. مدل می‌تواند برنامه‌ریزی کند، ابزارهایی مانند مرورگر و ترمینال را به کار بگیرد و برای کارهای کدنویسی، knowledge work و وظایف چندمرحله‌ای مستقل‌تر عمل کند. تصمیم محصول

انتشار: ۹ تیر ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای Claude Sonnet ۵؛ عامل‌محوری ارزان‌تر با کنترل سطح تلاش
تصویر رسمی Anthropic؛ منبع تصویر: https://www.anthropic.com/news/claude-sonnet-5

Claude Sonnet ۵؛ عامل‌محوری ارزان‌تر با کنترل سطح تلاش

Anthropic در ۳۰ ژوئن ۲۰۲۶ Claude Sonnet ۵ را عرضه کرد و آن را عامل‌محورترین مدل Sonnet نامید. مدل می‌تواند برنامه‌ریزی کند، ابزارهایی مانند مرورگر و ترمینال را به کار بگیرد و برای کارهای کدنویسی، knowledge work و وظایف چندمرحله‌ای مستقل‌تر عمل کند. تصمیم محصول در این معرفی فقط افزایش توان نیست؛ Anthropic می‌خواهد بخشی از عملکرد مدل‌های بزرگ‌تر را با هزینه و سرعت خانواده Sonnet در اختیار تیم‌های بیشتری بگذارد.

#فاصله با نسل قبل

مقایسه رسمی Sonnet ۵ با Sonnet ۴.۶ روی reasoning، tool use، coding و کار حرفه‌ای انجام شده است. Anthropic می‌گوید مدل جدید در برخی ارزیابی‌ها به Opus ۴.۸ نزدیک می‌شود، اما این جمله را باید در کنار نوع ارزیابی و سطح effort خواند. مدل می‌تواند برای یک مسئله ساده با effort پایین پاسخ سریع بدهد و برای مسئله پیچیده زمان محاسبه بیشتری صرف کند. این کنترل، امکان ساخت مسیر cost-performance را فراهم می‌کند، ولی انتخاب effort نامناسب می‌تواند کیفیت یا هزینه را تغییر دهد.

در صفحه رسمی، Sonnet ۵ در BrowseComp و OSWorld-Verified در چند سطح تلاش مقایسه شده است. این داده‌ها برای انتخاب اولیه مفیدند، اما تیم باید وظایف خود را جداگانه نمونه‌برداری کند. جست‌وجوی وب، اصلاح یک مخزن و کار با سامانه داخلی سه نوع شکست متفاوت دارند؛ امتیاز یک جدول نمی‌گوید مدل در هر سه به یک اندازه قابل اعتماد است.

#ایمنی و دسترسی

Sonnet ۵ در Cyber Verification Program قرار دارد. Anthropic گزارش کرده که نرخ رفتارهای نامطلوب نسبت به Sonnet ۴.۶ پایین‌تر بوده و توان انجام کارهای سایبری آن از مدل‌های Opus فعلی کمتر است. این بیان، نتیجه ارزیابی است نه تضمین امنیت. عامل متصل به ابزار همچنان می‌تواند دستور خطرناک را اجرا کند یا داده نامناسب را به زمینه وارد کند؛ permission و sandbox باید بیرون از مدل اعمال شوند.

مدل در Claude.ai برای همه پلن‌ها در دسترس اعلام شد و در Claude Code و Claude Platform نیز عرضه شد. نرخ مقدماتی API تا ۳۱ اوت ۲۰۲۶ برای هر یک میلیون توکن ورودی ۲ دلار و برای خروجی ۱۰ دلار است؛ پس از آن نرخ‌ها به‌ترتیب ۳ و ۱۵ دلار اعلام شده‌اند. rate limitها نیز برای افزایش مصرف ناشی از effort بالاتر تغییر کرده‌اند.

برای مهندس، Sonnet ۵ یک گزینه میانی با طیف تلاش قابل تنظیم است. مسیر درست این است که کارهای تکراری و کم‌ریسک را با effort پایین، و تغییرات پیچیده را با effort بالاتر و approval انسانی اجرا کند. مدل ارزان‌تر زمانی ارزش دارد که کیفیت patch، زمان بازبینی و هزینه retry هم در محاسبه وارد شوند.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه