پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

هارنس Copilot؛ لایه‌ای که مدل را به عامل کدنویسی تبدیل می‌کند

در ارزیابی ۲۵ ژوئن ۲۰۲۶، GitHub یک نکته معماری را برجسته کرد: مدل خام فقط بخشی از توانایی عامل کدنویسی است. هارنس Copilot ابزارها، زمینه و workflow را هماهنگ می‌کند و در Copilot CLI، اپلیکیشن، code review و SDK مشترک است. اگر این لایه بهتر شود، چند سطح محصول م

انتشار: ۴ تیر ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی GitHub برای هارنس Copilot؛ لایه‌ای که مدل را به عامل کدنویسی تبدیل می‌کند
تصویر رسمی GitHub؛ منبع تصویر: https://github.blog/ai-and-ml/github-copilot/evaluating-performance-and-efficiency-of-the-github-copilot-agentic-harness-across-models-and-tasks/

هارنس Copilot؛ لایه‌ای که مدل را به عامل کدنویسی تبدیل می‌کند

در ارزیابی ۲۵ ژوئن ۲۰۲۶، GitHub یک نکته معماری را برجسته کرد: مدل خام فقط بخشی از توانایی عامل کدنویسی است. هارنس Copilot ابزارها، زمینه و workflow را هماهنگ می‌کند و در Copilot CLI، اپلیکیشن، code review و SDK مشترک است. اگر این لایه بهتر شود، چند سطح محصول می‌تواند هم‌زمان از آن سود ببرد؛ اگر بد طراحی شود، مدل قوی هم در یک نشست طولانی گرفتار زمینه اضافی می‌شود.

#آزمایش منصفانه یعنی کنترل متغیرها

GitHub برای مقایسه هارنس خود با هارنس سازنده مدل تلاش کرده متغیرهایی مانند مدل، وظیفه benchmark، اندازه context، سطح reasoning، انتخاب ابزار و MCP server را نرمال کند. این تصمیم مهم است، چون مقایسه یک مدل در دو محیط متفاوت ممکن است در واقع تفاوت orchestration را اندازه بگیرد.

در گزارش، بنچمارک‌هایی مانند SWE-bench Verified، SWE-bench Pro، SkillsBench، TerminalBench و Win-Hill بررسی می‌شوند. هر کدام چیز متفاوتی را می‌سنجند: از اصلاح باگ‌های اعتبارسنجی‌شده تا کار ترمینالی و استفاده از skill. پس یک «امتیاز کلی» وجود ندارد که بتواند کیفیت عامل را در همه پروژه‌ها خلاصه کند.

#چرا مصرف توکن مهم است؟

نشست کدنویسی فقط متن نهایی نیست. عامل باید دستورها، ساختار repository، تاریخچه گفت‌وگو، ابزارها و وضعیت فعلی کار را در اختیار داشته باشد. هارنس می‌تواند این اطلاعات را فشرده، cache یا بر اساس نیاز بارگذاری کند. کاهش token consumption در اینجا فقط مسئله کاهش هزینه نیست؛ زمینه کمتر، latency پایین‌تر و خطای کمتر در انتخاب ابزار را نیز ممکن می‌کند.

گزارش GitHub از عملکرد خوب در برابر هارنس‌های ارائه‌دهندگان سخن می‌گوید، اما باید آن را نتیجه ارزیابی داخلی و عمومی همان تیم دانست. توسعه‌دهنده‌ای که می‌خواهد تصمیم بگیرد، بهتر است مخزن خود را با issueهای واقعی، تست‌های واقعی و محدودیت شبکه خودش آزمایش کند. بنچمارک عمومی برای مقایسه مفید است، ولی قرارداد کیفیت پروژه نیست.

#پیاده‌سازی برای تیم

هارنس موفق باید به کاربر نشان دهد عامل چه contextی گرفته، چه ابزاری را صدا زده و کجا نیاز به تصمیم انسانی دارد. برای سازمان، این یعنی لاگ نشست، محدودیت permission و امکان قطع job باید بخشی از محصول باشند. ارزش Copilot فقط در انتخاب مدل نیست؛ در تبدیل یک مدل عمومی به workflow قابل پیش‌بینی است.

از این زاویه، benchmark باید دو خروجی داشته باشد: کیفیت حل مسئله و هزینه رسیدن به آن. اگر عامل با توکن کمتر همان patch درست را بسازد، مزیت واقعی است؛ اما اگر برای کاهش توکن بخشی از زمینه لازم حذف شود و نرخ اصلاح انسانی بالا برود، صرفه‌جویی فقط به شاخصی روی داشبورد تبدیل می‌شود. تیم‌ها باید این دو عدد را روی issueهای مشابه و در چند نسخه هارنس دنبال کنند.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها
هوش مصنوعی

Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها

OpenAI قابلیت multi-agent را در Responses API به‌صورت beta معرفی کرده است. در این الگو، یک نمونه GPT‑۵.۶ می‌تواند چند زیرعامل را برای بخش‌های مستقل یک مسئله هماهنگ کند و نتیجه‌ها را ترکیب کند. وعده اصلی، کاهش زمان wall-clock و بهتر شدن کارهای پیچیده‌ای است که

۱۸ تیر ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی
هوش مصنوعی

سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی

سیستم‌کارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، به‌جای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال می‌کند. GPT‑۵.۶ خانواده‌ای از Sol، Terra و Luna است و در ارزیابی‌های OpenAI در امنیت سایبری و زیست‌شناسی در سطح High capability قر

۱۸ تیر ۱۴۰۵3 دقیقه