پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند

در مدل‌های عامل‌محور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبه‌رو می‌شود و همین تجربه می‌تواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت infere

انتشار: ۲۶ تیر ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی NVIDIA برای Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند
تصویر رسمی NVIDIA؛ منبع تصویر: https://blogs.nvidia.com/blog/nvidia-vera-rubin-post-training-intelligence-per-dollar/

Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند

در مدل‌های عامل‌محور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبه‌رو می‌شود و همین تجربه می‌تواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت inference به «هوش به ازای هر دلار» نزدیک می‌کند و Vera Rubin را برای چنین بارهایی معرفی کرد.

#post-training یک حلقه است

در pretraining، مدل از حجم بزرگی از داده الگوهای زبانی می‌آموزد. در post-training، سیستم برای برنامه‌ریزی، استفاده از ابزار، اصلاح خطا و انجام task مشخص‌تر تنظیم می‌شود. در روایت NVIDIA، عامل تلاش می‌کند، نتیجه‌اش امتیاز می‌گیرد و وزن‌ها با روش‌هایی مانند reinforcement learning به‌روزرسانی می‌شوند. اجرای این loop به محیط‌های متعدد، rolloutهای موازی و انتقال پیوسته وزن و ارزیابی نیاز دارد.

این تفاوت برای تیمی که فقط هزینه پاسخ را اندازه می‌گیرد مهم است. cost per token درباره سرویس inference است؛ intelligence per dollar درباره هزینه ساختن و حفظ کیفیت مدلی است که آن توکن‌ها را تولید می‌کند. این دو معیار رقیب نیستند. زیرساخت ارزان‌تر می‌تواند هم سرویس‌دهی را کم‌هزینه کند و هم تعداد آزمایش‌های post-training را افزایش دهد.

#ادعا درباره Vera Rubin

NVIDIA می‌گوید Vera Rubin برای اجرای مدل‌های بزرگ و چرخه‌های مکرر post-training طراحی شده و می‌تواند مدل‌های بزرگ را با یک‌چهارم GPUهای نسل Blackwell آموزش دهد. چنین ادعایی به پیکربندی دقیق، نرم‌افزار، نوع workload و روش مقایسه وابسته است. بنابراین تصمیم خرید باید بر اساس trace و workload خود سازمان باشد، نه فقط یک نسبت تبلیغاتی.

در همان مطلب، Nemotron 3 Ultra به‌عنوان مدل open-weight با ۵۵۰ میلیارد پارامتر و نتیجه ۷۱٫۷ درصد در SWE-bench Verified معرفی شده است. این عدد یک benchmark مشخص با پروتکل مشخص است؛ نباید آن را به همه وظایف کدنویسی یا توانایی عمومی عامل تعمیم داد.

#هزینه پنهان چرخه یادگیری

post-training پیوسته به storage برای trajectoryها، محیط‌های sandbox، evaluatorهای قابل اعتماد و orchestration نیاز دارد. اگر reward اشتباه باشد، محاسبه بیشتر فقط رفتار نامطلوب را سریع‌تر تقویت می‌کند. تیم باید تغییر کیفیت، هزینه، latency و regressions را در کنار هم ببیند و امکان بازگشت به checkpoint قبلی را حفظ کند.

Vera Rubin در این داستان فقط سخت‌افزار تازه نیست؛ نشانه تغییری در اقتصاد مدل‌های agentic است. ارزش زیرساخت زمانی ثابت می‌شود که چرخه داده، آزمایش و استقرار با معیارهای شفاف اداره شود، نه زمانی که تنها ظرفیت خام accelerator افزایش پیدا کند.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه