AgentPerf؛ چرا بنچمارک تکپاسخی برای عاملها کافی نیست
یک پاسخ چت معمولاً یک درخواست و یک خروجی دارد. عامل کدنویسی مسیر طولانیتری میسازد: فایل میخواند، برنامه مینویسد، فرمان اجرا میکند، خطا را میبیند و دوباره تصمیم میگیرد. NVIDIA در ۱۲ ژوئن ۲۰۲۶ نتایج نخست AgentPerf را منتشر کرد؛ بنچمارکی از Artificial Anal

AgentPerf؛ چرا بنچمارک تکپاسخی برای عاملها کافی نیست
یک پاسخ چت معمولاً یک درخواست و یک خروجی دارد. عامل کدنویسی مسیر طولانیتری میسازد: فایل میخواند، برنامه مینویسد، فرمان اجرا میکند، خطا را میبیند و دوباره تصمیم میگیرد. NVIDIA در ۱۲ ژوئن ۲۰۲۶ نتایج نخست AgentPerf را منتشر کرد؛ بنچمارکی از Artificial Analysis که برای سنجش بارهای عاملمحور و تعداد taskهای همزمان طراحی شده است.
#واحد اندازهگیری تغییر میکند
در inference عادی، latency پاسخ و تعداد درخواستهای همزمان معیارهای آشنا هستند. در عامل، دهها یا صدها فراخوانی مدل و ابزار به هم زنجیر میشوند و context در هر مرحله رشد میکند. تأخیر یک ابزار، زمان compile یا فشار memory میتواند تجربه کل task را تغییر دهد. به همین دلیل، سریع بودن یک completion منفرد تضمین نمیکند که عامل کار را سریع تمام کند.
AgentPerf از trajectoryهای واقعی coding agent استفاده میکند. عامل یک task را از repository عمومی میگیرد، فایلها را بررسی میکند، تغییر میدهد و فرمان اجرا میکند. در آزمون، tool callها با زمان پردازشی نماینده شبیهسازی میشوند تا مقایسه بیشتر روی رفتار زیرساخت متمرکز بماند. این روش با production یکسان نیست، اما از benchmark تکپاسخی به workload نزدیکتری دارد.
#نتیجه اعلامشده
در workload منتشرشده، NVIDIA GB300 NVL72 تا ۲۰ برابر عامل بیشتر به ازای هر مگاوات نسبت به سیستم Hopper اجرا کرده است. NVIDIA این نتیجه را برای مقایسه مشخص AgentPerf و مدل DeepSeek V4 Pro گزارش میکند. عدد «۲۰ برابر» را نباید به همه مدلها، همه نرمافزارها یا همه دیتاسنترها تعمیم داد؛ مدل، SLO، concurrency و پیکربندی شبکه در نتیجه نقش دارند.
GB300 NVL72 با اتصال ۷۲ GPU در یک rack-scale system، CUDA و TensorRT-LLM برای مدلهای MoE و نشستهای همزمان بهینه شده است. این جزئیات نشان میدهند برتری فقط از یک تراشه نمیآید. انتقال داده، overlap محاسبه و ارتباط میان expertها نیز بخشی از کارایی نهاییاند.
#برای خریدار زیرساخت چه معنایی دارد؟
تیم زیرساخت باید ابتدا trajectoryهای خودش را تعریف کند. آیا عامل بیشتر جستوجوی کد انجام میدهد یا compile و test؟ متوسط طول نشست چقدر است؟ چه SLOای برای زمان پاسخ هر مرحله و پایان کل task لازم است؟ پاسخ به این پرسشها کمک میکند نتیجه AgentPerf به ظرفیت واقعی نزدیک شود.
همچنین مصرف برق باید کنار throughput و نرخ موفقیت دیده شود. اجرای عاملهای بیشتر با خطای بیشتر یا review انسانی سنگین لزوماً بهرهوری نیست. AgentPerf یک ابزار مقایسه است، نه جایگزین پایلوت. ارزش آن در این است که بحث زیرساخت را از «چند token در ثانیه» به «چند کار مفید با چه هزینه و انرژی» منتقل میکند.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

Vera Rubin و محاسبهای که پس از آموزش مدل ادامه پیدا میکند
در مدلهای عاملمحور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبهرو میشود و همین تجربه میتواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت infere

Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عاملها
OpenAI قابلیت multi-agent را در Responses API بهصورت beta معرفی کرده است. در این الگو، یک نمونه GPT‑۵.۶ میتواند چند زیرعامل را برای بخشهای مستقل یک مسئله هماهنگ کند و نتیجهها را ترکیب کند. وعده اصلی، کاهش زمان wall-clock و بهتر شدن کارهای پیچیدهای است که

واترمارک متنی Claude؛ نشانهگذاری آماری بهجای ادعای تشخیص قطعی
Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر میده