Vera Rubin و محاسبهای که پس از آموزش مدل ادامه پیدا میکند
در مدلهای عاملمحور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبهرو میشود و همین تجربه میتواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت infere

Vera Rubin و محاسبهای که پس از آموزش مدل ادامه پیدا میکند
در مدلهای عاملمحور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبهرو میشود و همین تجربه میتواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت inference به «هوش به ازای هر دلار» نزدیک میکند و Vera Rubin را برای چنین بارهایی معرفی کرد.
#post-training یک حلقه است
در pretraining، مدل از حجم بزرگی از داده الگوهای زبانی میآموزد. در post-training، سیستم برای برنامهریزی، استفاده از ابزار، اصلاح خطا و انجام task مشخصتر تنظیم میشود. در روایت NVIDIA، عامل تلاش میکند، نتیجهاش امتیاز میگیرد و وزنها با روشهایی مانند reinforcement learning بهروزرسانی میشوند. اجرای این loop به محیطهای متعدد، rolloutهای موازی و انتقال پیوسته وزن و ارزیابی نیاز دارد.
این تفاوت برای تیمی که فقط هزینه پاسخ را اندازه میگیرد مهم است. cost per token درباره سرویس inference است؛ intelligence per dollar درباره هزینه ساختن و حفظ کیفیت مدلی است که آن توکنها را تولید میکند. این دو معیار رقیب نیستند. زیرساخت ارزانتر میتواند هم سرویسدهی را کمهزینه کند و هم تعداد آزمایشهای post-training را افزایش دهد.
#ادعا درباره Vera Rubin
NVIDIA میگوید Vera Rubin برای اجرای مدلهای بزرگ و چرخههای مکرر post-training طراحی شده و میتواند مدلهای بزرگ را با یکچهارم GPUهای نسل Blackwell آموزش دهد. چنین ادعایی به پیکربندی دقیق، نرمافزار، نوع workload و روش مقایسه وابسته است. بنابراین تصمیم خرید باید بر اساس trace و workload خود سازمان باشد، نه فقط یک نسبت تبلیغاتی.
در همان مطلب، Nemotron 3 Ultra بهعنوان مدل open-weight با ۵۵۰ میلیارد پارامتر و نتیجه ۷۱٫۷ درصد در SWE-bench Verified معرفی شده است. این عدد یک benchmark مشخص با پروتکل مشخص است؛ نباید آن را به همه وظایف کدنویسی یا توانایی عمومی عامل تعمیم داد.
#هزینه پنهان چرخه یادگیری
post-training پیوسته به storage برای trajectoryها، محیطهای sandbox، evaluatorهای قابل اعتماد و orchestration نیاز دارد. اگر reward اشتباه باشد، محاسبه بیشتر فقط رفتار نامطلوب را سریعتر تقویت میکند. تیم باید تغییر کیفیت، هزینه، latency و regressions را در کنار هم ببیند و امکان بازگشت به checkpoint قبلی را حفظ کند.
Vera Rubin در این داستان فقط سختافزار تازه نیست؛ نشانه تغییری در اقتصاد مدلهای agentic است. ارزش زیرساخت زمانی ثابت میشود که چرخه داده، آزمایش و استقرار با معیارهای شفاف اداره شود، نه زمانی که تنها ظرفیت خام accelerator افزایش پیدا کند.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

واترمارک متنی Claude؛ نشانهگذاری آماری بهجای ادعای تشخیص قطعی
Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر میده

GPT-۵.۶ ارزانتر شد؛ Fast Mode برای کدام بار کاری است؟
اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادیتر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریعتر برای

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابیهای امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترلشده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،