پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

Claude Opus ۴.۷؛ وقتی مدل کدنویسی باید خروجی خودش را وارسی کند

Anthropic در ۱۶ آوریل ۲۰۲۶ Claude Opus ۴.۷ را عمومی کرد. تمرکز اعلامیه روی مهندسی نرم‌افزار دشوار، کارهای طولانی و توانایی مدل برای بررسی خروجی خودش بود. Opus ۴.۷ در محصولات Claude، API و مسیرهای ابری Amazon Bedrock، Google Cloud Vertex AI و Microsoft Foundry

انتشار: ۲۷ فروردین ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای Claude Opus ۴.۷؛ وقتی مدل کدنویسی باید خروجی خودش را وارسی کند
تصویر رسمی Anthropic؛ منبع تصویر: https://www.anthropic.com/news/claude-opus-4-7

Claude Opus ۴.۷؛ وقتی مدل کدنویسی باید خروجی خودش را وارسی کند

Anthropic در ۱۶ آوریل ۲۰۲۶ Claude Opus ۴.۷ را عمومی کرد. تمرکز اعلامیه روی مهندسی نرم‌افزار دشوار، کارهای طولانی و توانایی مدل برای بررسی خروجی خودش بود. Opus ۴.۷ در محصولات Claude، API و مسیرهای ابری Amazon Bedrock، Google Cloud Vertex AI و Microsoft Foundry در دسترس قرار گرفت؛ این تفاوت میان «عرضه عمومی مدل» و «فعال بودن آن برای هر حساب» همچنان باید در قرارداد هر ارائه‌دهنده بررسی شود.

#تغییر اصلی برای مهندسی نرم‌افزار

مدل‌های کدنویسی زمانی مفیدند که فقط قطعه کد تولید نکنند. پروژه واقعی به خواندن ساختار مخزن، فهم وابستگی‌ها، اجرای آزمون، تحلیل شکست و اصلاح مرحله‌ای نیاز دارد. Anthropic Opus ۴.۷ را برای چنین کارهایی توصیف می‌کند و از دقت بیشتر در دستورها، پایداری در وظایف چندمرحله‌ای و توانایی طراحی راهی برای راستی‌آزمایی خروجی سخن می‌گوید.

این توصیف به معنی حذف بازبینی انسانی نیست. «خودبازبینی» زمانی ارزش دارد که مدل بتواند آزمون مناسب را اجرا کند و نتیجه را درست تفسیر کند؛ اگر محیط ناقص باشد یا پوشش تست پایین باشد، یک حلقه خودکار فقط اعتماد کاذب می‌سازد. در تیم حرفه‌ای، pull request، log اجرا و تغییرات فایل باید مستقل از ادعای مدل قابل بررسی بماند.

#بینایی و کار دانشی

اعلامیه همچنین به بهبود بینایی و خروجی‌های حرفه‌ای مانند رابط، اسلاید و سند اشاره دارد. برای توسعه‌دهنده، بینایی بهتر می‌تواند به فهم screenshot، خطای layout یا رفتار یک رابط کمک کند؛ اما این قابلیت جای معیارهای دسترس‌پذیری، تست مرورگر و بازخورد کاربر را نمی‌گیرد. مدل می‌تواند نشانه مشکل را ببیند، ولی اصلاح پایدار نیازمند بازتولید مسئله است.

Anthropic Opus ۴.۷ را در برابر Opus ۴.۶ و مدل‌های دیگر در چند بنچمارک مقایسه کرده است. مقاله خبر بهبود را گزارش می‌کند، اما انتخاب مدل باید بر اساس زبان، اندازه مخزن، ابزارهای در دسترس و هزینه انجام شود. امتیاز یک آزمون عمومی تضمین نمی‌کند که مدل در یک کدبیس خصوصی با build شکننده بهتر عمل کند.

#پیام برای تیم زیرساخت

اگر قرار است Opus ۴.۷ در workflow کدنویسی استفاده شود، سه لایه را جدا کنید: محیط اجرای محدود، اختیار ابزارها و مرحله تأیید merge. نگه‌داشتن secretها خارج از workspace عامل، محدود کردن دسترسی شبکه و الزام به اجرای تست‌های قابل تکرار، از انتخاب مدل مهم‌تر است. ارزش واقعی این نسخه وقتی روشن می‌شود که زمان حل مسئله کم شود بدون آنکه بار بازبینی و ریسک تغییر پنهان افزایش یابد.

یک معیار عملی برای pilot، مقایسه زمان رسیدن از issue به patch قابل بررسی است؛ نه شمارش خطوطی که مدل نوشته. تیم باید تعداد رفت‌وبرگشت اصلاح، تست‌های شکست‌خورده و تغییرات ردشده را هم ثبت کند. اگر Opus ۴.۷ کد بیشتری تولید کند اما بررسی آن دشوارتر شود، بهبود ظاهری به بهره‌وری واقعی تبدیل نشده است.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه