پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

AgentPerf؛ چرا بنچمارک تک‌پاسخی برای عامل‌ها کافی نیست

یک پاسخ چت معمولاً یک درخواست و یک خروجی دارد. عامل کدنویسی مسیر طولانی‌تری می‌سازد: فایل می‌خواند، برنامه می‌نویسد، فرمان اجرا می‌کند، خطا را می‌بیند و دوباره تصمیم می‌گیرد. NVIDIA در ۱۲ ژوئن ۲۰۲۶ نتایج نخست AgentPerf را منتشر کرد؛ بنچمارکی از Artificial Anal

انتشار: ۲۲ خرداد ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی NVIDIA برای AgentPerf؛ چرا بنچمارک تک‌پاسخی برای عامل‌ها کافی نیست
تصویر رسمی NVIDIA؛ منبع تصویر: https://blogs.nvidia.com/blog/nvidia-blackwell-agentperf-artificial-analysis/

AgentPerf؛ چرا بنچمارک تک‌پاسخی برای عامل‌ها کافی نیست

یک پاسخ چت معمولاً یک درخواست و یک خروجی دارد. عامل کدنویسی مسیر طولانی‌تری می‌سازد: فایل می‌خواند، برنامه می‌نویسد، فرمان اجرا می‌کند، خطا را می‌بیند و دوباره تصمیم می‌گیرد. NVIDIA در ۱۲ ژوئن ۲۰۲۶ نتایج نخست AgentPerf را منتشر کرد؛ بنچمارکی از Artificial Analysis که برای سنجش بارهای عامل‌محور و تعداد taskهای هم‌زمان طراحی شده است.

#واحد اندازه‌گیری تغییر می‌کند

در inference عادی، latency پاسخ و تعداد درخواست‌های هم‌زمان معیارهای آشنا هستند. در عامل، ده‌ها یا صدها فراخوانی مدل و ابزار به هم زنجیر می‌شوند و context در هر مرحله رشد می‌کند. تأخیر یک ابزار، زمان compile یا فشار memory می‌تواند تجربه کل task را تغییر دهد. به همین دلیل، سریع بودن یک completion منفرد تضمین نمی‌کند که عامل کار را سریع تمام کند.

AgentPerf از trajectoryهای واقعی coding agent استفاده می‌کند. عامل یک task را از repository عمومی می‌گیرد، فایل‌ها را بررسی می‌کند، تغییر می‌دهد و فرمان اجرا می‌کند. در آزمون، tool callها با زمان پردازشی نماینده شبیه‌سازی می‌شوند تا مقایسه بیشتر روی رفتار زیرساخت متمرکز بماند. این روش با production یکسان نیست، اما از benchmark تک‌پاسخی به workload نزدیک‌تری دارد.

#نتیجه اعلام‌شده

در workload منتشرشده، NVIDIA GB300 NVL72 تا ۲۰ برابر عامل بیشتر به ازای هر مگاوات نسبت به سیستم Hopper اجرا کرده است. NVIDIA این نتیجه را برای مقایسه مشخص AgentPerf و مدل DeepSeek V4 Pro گزارش می‌کند. عدد «۲۰ برابر» را نباید به همه مدل‌ها، همه نرم‌افزارها یا همه دیتاسنترها تعمیم داد؛ مدل، SLO، concurrency و پیکربندی شبکه در نتیجه نقش دارند.

GB300 NVL72 با اتصال ۷۲ GPU در یک rack-scale system، CUDA و TensorRT-LLM برای مدل‌های MoE و نشست‌های هم‌زمان بهینه شده است. این جزئیات نشان می‌دهند برتری فقط از یک تراشه نمی‌آید. انتقال داده، overlap محاسبه و ارتباط میان expertها نیز بخشی از کارایی نهایی‌اند.

#برای خریدار زیرساخت چه معنایی دارد؟

تیم زیرساخت باید ابتدا trajectoryهای خودش را تعریف کند. آیا عامل بیشتر جست‌وجوی کد انجام می‌دهد یا compile و test؟ متوسط طول نشست چقدر است؟ چه SLOای برای زمان پاسخ هر مرحله و پایان کل task لازم است؟ پاسخ به این پرسش‌ها کمک می‌کند نتیجه AgentPerf به ظرفیت واقعی نزدیک شود.

همچنین مصرف برق باید کنار throughput و نرخ موفقیت دیده شود. اجرای عامل‌های بیشتر با خطای بیشتر یا review انسانی سنگین لزوماً بهره‌وری نیست. AgentPerf یک ابزار مقایسه است، نه جایگزین پایلوت. ارزش آن در این است که بحث زیرساخت را از «چند token در ثانیه» به «چند کار مفید با چه هزینه و انرژی» منتقل می‌کند.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی NVIDIA برای Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند
هوش مصنوعی

Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند

در مدل‌های عامل‌محور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبه‌رو می‌شود و همین تجربه می‌تواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت infere

۲۶ تیر ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها
هوش مصنوعی

Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها

OpenAI قابلیت multi-agent را در Responses API به‌صورت beta معرفی کرده است. در این الگو، یک نمونه GPT‑۵.۶ می‌تواند چند زیرعامل را برای بخش‌های مستقل یک مسئله هماهنگ کند و نتیجه‌ها را ترکیب کند. وعده اصلی، کاهش زمان wall-clock و بهتر شدن کارهای پیچیده‌ای است که

۱۸ تیر ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه