AI Factory؛ چرا معیار زیرساخت از FLOPS به هزینه هر توکن میرود
NVIDIA در ۲۷ مه ۲۰۲۶ مفهوم AI Factory را بهعنوان زیرساختی برای تولید پیوسته intelligence توضیح داد. استعاره کارخانه به این دلیل انتخاب شده که بار کاری جدید فقط آموزش یک مدل نیست: سامانه باید بیوقفه inference انجام دهد، عاملها را هماهنگ کند، زمینه طولانی را

AI Factory؛ چرا معیار زیرساخت از FLOPS به هزینه هر توکن میرود
NVIDIA در ۲۷ مه ۲۰۲۶ مفهوم AI Factory را بهعنوان زیرساختی برای تولید پیوسته intelligence توضیح داد. استعاره کارخانه به این دلیل انتخاب شده که بار کاری جدید فقط آموزش یک مدل نیست: سامانه باید بیوقفه inference انجام دهد، عاملها را هماهنگ کند، زمینه طولانی را جابهجا کند و با تأخیر قابل قبول به درخواست بعدی برسد.
#محصول کارخانه چیست؟
در نگاه NVIDIA، خروجی چنین مرکز دادهای توکن است. بنابراین شاخصهایی مانند token per second، token per watt، هزینه هر توکن، utilization و uptime به اندازه قدرت خام GPU اهمیت پیدا میکنند. این نگاه برای مدیر زیرساخت آشناست: اگر سیستم فقط در آزمون peak خوب باشد اما در بار واقعی حافظه، شبکه یا orchestration آن را متوقف کند، ظرفیت نظری به ارزش عملی تبدیل نمیشود.
عاملها این مسئله را سختتر میکنند. یک درخواست عاملمحور ممکن است چند مرحله استدلال، جستوجو، فراخوانی ابزار، اجرای کد و بررسی نتیجه داشته باشد. هر مرحله context و latency خاص خود را دارد. بنابراین معماری باید compute، memory، storage، networking، CPU و نرمافزار orchestration را با هم ببیند؛ bottleneck در یک لایه میتواند کل زنجیره را کند کند.
#اعداد را چگونه بخوانیم؟
NVIDIA در مطلب خود به مقایسههای SemiAnalysis InferenceX اشاره میکند و میگوید سامانههای Blackwell Ultra در سناریوهای مشخص تا ۵۰ برابر توکن بیشتر به ازای هر مگاوات و ۳۵ برابر هزینه کمتر به ازای توکن نسبت به پلتفرم Hopper میدهند. این اعداد ادعای vendor در یک چارچوب آزمون مشخصاند، نه نتیجهای که برای هر مدل، شبکه یا طراحی مرکز داده تکرار شود.
همین محدودیت، اهمیت روش اندازهگیری را نشان میدهد. سازمان باید نرخ موفقیت کار، زمان پایان workflow، هزینه cache، مصرف برق و میزان استفاده واقعی را کنار هم ثبت کند. مقایسه GPU بدون در نظر گرفتن batching، طول خروجی و رفتار retry تصویر ناقصی میدهد.
#از تراشه تا عملیات
AI Factory در این روایت یک رک کامل نیست. NVIDIA از طراحی full-stack، سیستمهای liquid-cooled، نرمافزار inference، عاملهای خودکار و حتی digital twin برای برنامهریزی تأسیسات سخن میگوید. اینجا نقش DevOps و SRE پررنگ میشود: مدل باید version شود، rollout قابل بازگشت باشد و افت کیفیت یا افزایش هزینه زود دیده شود.
برای شرکت کوچک، نتیجه الزاماً ساخت مرکز داده گیگاواتی نیست. میتوان همین منطق را در مقیاس یک سرویس داخلی به کار برد: هزینه هر وظیفه را بسنجید، utilization را رصد کنید و انتخاب مدل را با بار کاری هماهنگ کنید. AI Factory بیش از آنکه نام یک محصول باشد، تغییر واحد حسابداری زیرساخت است.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

Vera Rubin و محاسبهای که پس از آموزش مدل ادامه پیدا میکند
در مدلهای عاملمحور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبهرو میشود و همین تجربه میتواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت infere

Microsoft Foundry؛ مدل، runtime و مسیر انتشار عامل در یک سکوی سازمانی
اعلامیه ۹ ژوئیه ۲۰۲۶ Microsoft Foundry فقط خبر اضافه شدن یک مدل به کاتالوگ نیست. Microsoft همزمان از دسترسی عمومی GPT-۵.۶ در Foundry، Data Zone آسیا-اقیانوسیه و عمومی شدن hosted agents در Foundry Agent Service خبر داد. ترکیب این سه تغییر، مسئلهای را هدف میگ

Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عاملها
OpenAI قابلیت multi-agent را در Responses API بهصورت beta معرفی کرده است. در این الگو، یک نمونه GPT‑۵.۶ میتواند چند زیرعامل را برای بخشهای مستقل یک مسئله هماهنگ کند و نتیجهها را ترکیب کند. وعده اصلی، کاهش زمان wall-clock و بهتر شدن کارهای پیچیدهای است که