پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

AI Factory؛ چرا معیار زیرساخت از FLOPS به هزینه هر توکن می‌رود

NVIDIA در ۲۷ مه ۲۰۲۶ مفهوم AI Factory را به‌عنوان زیرساختی برای تولید پیوسته intelligence توضیح داد. استعاره کارخانه به این دلیل انتخاب شده که بار کاری جدید فقط آموزش یک مدل نیست: سامانه باید بی‌وقفه inference انجام دهد، عامل‌ها را هماهنگ کند، زمینه طولانی را

انتشار: ۶ خرداد ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی NVIDIA برای AI Factory؛ چرا معیار زیرساخت از FLOPS به هزینه هر توکن می‌رود
تصویر رسمی NVIDIA؛ منبع تصویر: https://blogs.nvidia.com/blog/ai-factories-the-new-infrastructure-of-intelligence/

AI Factory؛ چرا معیار زیرساخت از FLOPS به هزینه هر توکن می‌رود

NVIDIA در ۲۷ مه ۲۰۲۶ مفهوم AI Factory را به‌عنوان زیرساختی برای تولید پیوسته intelligence توضیح داد. استعاره کارخانه به این دلیل انتخاب شده که بار کاری جدید فقط آموزش یک مدل نیست: سامانه باید بی‌وقفه inference انجام دهد، عامل‌ها را هماهنگ کند، زمینه طولانی را جابه‌جا کند و با تأخیر قابل قبول به درخواست بعدی برسد.

#محصول کارخانه چیست؟

در نگاه NVIDIA، خروجی چنین مرکز داده‌ای توکن است. بنابراین شاخص‌هایی مانند token per second، token per watt، هزینه هر توکن، utilization و uptime به اندازه قدرت خام GPU اهمیت پیدا می‌کنند. این نگاه برای مدیر زیرساخت آشناست: اگر سیستم فقط در آزمون peak خوب باشد اما در بار واقعی حافظه، شبکه یا orchestration آن را متوقف کند، ظرفیت نظری به ارزش عملی تبدیل نمی‌شود.

عامل‌ها این مسئله را سخت‌تر می‌کنند. یک درخواست عامل‌محور ممکن است چند مرحله استدلال، جست‌وجو، فراخوانی ابزار، اجرای کد و بررسی نتیجه داشته باشد. هر مرحله context و latency خاص خود را دارد. بنابراین معماری باید compute، memory، storage، networking، CPU و نرم‌افزار orchestration را با هم ببیند؛ bottleneck در یک لایه می‌تواند کل زنجیره را کند کند.

#اعداد را چگونه بخوانیم؟

NVIDIA در مطلب خود به مقایسه‌های SemiAnalysis InferenceX اشاره می‌کند و می‌گوید سامانه‌های Blackwell Ultra در سناریوهای مشخص تا ۵۰ برابر توکن بیشتر به ازای هر مگاوات و ۳۵ برابر هزینه کمتر به ازای توکن نسبت به پلتفرم Hopper می‌دهند. این اعداد ادعای vendor در یک چارچوب آزمون مشخص‌اند، نه نتیجه‌ای که برای هر مدل، شبکه یا طراحی مرکز داده تکرار شود.

همین محدودیت، اهمیت روش اندازه‌گیری را نشان می‌دهد. سازمان باید نرخ موفقیت کار، زمان پایان workflow، هزینه cache، مصرف برق و میزان استفاده واقعی را کنار هم ثبت کند. مقایسه GPU بدون در نظر گرفتن batching، طول خروجی و رفتار retry تصویر ناقصی می‌دهد.

#از تراشه تا عملیات

AI Factory در این روایت یک رک کامل نیست. NVIDIA از طراحی full-stack، سیستم‌های liquid-cooled، نرم‌افزار inference، عامل‌های خودکار و حتی digital twin برای برنامه‌ریزی تأسیسات سخن می‌گوید. اینجا نقش DevOps و SRE پررنگ می‌شود: مدل باید version شود، rollout قابل بازگشت باشد و افت کیفیت یا افزایش هزینه زود دیده شود.

برای شرکت کوچک، نتیجه الزاماً ساخت مرکز داده گیگاواتی نیست. می‌توان همین منطق را در مقیاس یک سرویس داخلی به کار برد: هزینه هر وظیفه را بسنجید، utilization را رصد کنید و انتخاب مدل را با بار کاری هماهنگ کنید. AI Factory بیش از آنکه نام یک محصول باشد، تغییر واحد حسابداری زیرساخت است.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی NVIDIA برای Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند
هوش مصنوعی

Vera Rubin و محاسبه‌ای که پس از آموزش مدل ادامه پیدا می‌کند

در مدل‌های عامل‌محور، آموزش پایان کار نیست. عامل بعد از استقرار با ابزار، کدبیس و edge caseهای تازه روبه‌رو می‌شود و همین تجربه می‌تواند به چرخه post-training برگردد. NVIDIA در ۱۷ ژوئیه ۲۰۲۶ استدلال کرد که این چرخه پیوسته، معیار زیرساخت را از صرفاً سرعت infere

۲۶ تیر ۱۴۰۵3 دقیقه
تصویر رسمی Microsoft Azure برای Microsoft Foundry؛ مدل، runtime و مسیر انتشار عامل در یک سکوی سازمانی
هوش مصنوعی

Microsoft Foundry؛ مدل، runtime و مسیر انتشار عامل در یک سکوی سازمانی

اعلامیه ۹ ژوئیه ۲۰۲۶ Microsoft Foundry فقط خبر اضافه شدن یک مدل به کاتالوگ نیست. Microsoft هم‌زمان از دسترسی عمومی GPT-۵.۶ در Foundry، Data Zone آسیا-اقیانوسیه و عمومی شدن hosted agents در Foundry Agent Service خبر داد. ترکیب این سه تغییر، مسئله‌ای را هدف می‌گ

۱۸ تیر ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها
هوش مصنوعی

Multi-agent در Responses API؛ تقسیم کار پیش از زیاد کردن عامل‌ها

OpenAI قابلیت multi-agent را در Responses API به‌صورت beta معرفی کرده است. در این الگو، یک نمونه GPT‑۵.۶ می‌تواند چند زیرعامل را برای بخش‌های مستقل یک مسئله هماهنگ کند و نتیجه‌ها را ترکیب کند. وعده اصلی، کاهش زمان wall-clock و بهتر شدن کارهای پیچیده‌ای است که

۱۸ تیر ۱۴۰۵3 دقیقه