پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ می‌دهد

گوگل در ۱۹ مه ۲۰۲۶ Gemini Omni را معرفی کرد و نخستین مدل این خانواده را Omni Flash نامید. ادعای اصلی «تولید هر چیز از هر ورودی» است، اما عرضه اولیه مشخص‌تر است: ترکیب تصویر، صدا، ویدئو و متن برای تولید و ویرایش ویدئو. Omni Flash در Gemini app، Google Flow و Yo

انتشار: ۲۹ اردیبهشت ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Google DeepMind برای Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ می‌دهد
تصویر رسمی Google DeepMind؛ منبع تصویر: https://blog.google/intl/en-ie/products/gemini-omni/

Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ می‌دهد

گوگل در ۱۹ مه ۲۰۲۶ Gemini Omni را معرفی کرد و نخستین مدل این خانواده را Omni Flash نامید. ادعای اصلی «تولید هر چیز از هر ورودی» است، اما عرضه اولیه مشخص‌تر است: ترکیب تصویر، صدا، ویدئو و متن برای تولید و ویرایش ویدئو. Omni Flash در Gemini app، Google Flow و YouTube Shorts برای مشترکان Google AI Plus، Pro و Ultra در سراسر جهان rollout شد.

#از فهم تصویر تا ساخت صحنه

مدل‌های قبلی Gemini می‌توانستند ورودی‌های چندوجهی را تحلیل کنند و Nano Banana تصویر بسازند یا ویرایش کند. Omni این دو مسیر را به تولید ویدئو نزدیک می‌کند. کاربر می‌تواند چند عکس، توضیح صوتی و متن را کنار هم بگذارد و خروجی ویدئویی بسازد که به دانش دنیای Gemini متکی باشد. سپس ویدئو با گفت‌وگو اصلاح شود؛ مثلاً قاب، حرکت یا عناصر یک صحنه تغییر کند.

این جریان برای creatorها جذاب است، اما consistency در ویدئو دشوارتر از یک تصویر ثابت است. هویت کاراکتر، نور، زمان‌بندی و رابطه علت و معلولی باید در فریم‌های متعدد حفظ شود. prompt بهتر فقط بخشی از مسئله است؛ تیم تولید باید خروجی را در طول ویدئو مرور کند و خطاهای حرکتی یا محتوایی را جداگانه بررسی کند.

#Flow و YouTube Shorts

قرار گرفتن Omni Flash در Google Flow آن را به workflow ساخت ویدئو نزدیک می‌کند. YouTube Shorts نیز سطح توزیع است، نه صرفاً ابزار آزمایش. وقتی خروجی در پلتفرم عمومی منتشر می‌شود، provenance، رضایت استفاده از چهره و شفافیت درباره تولید مصنوعی اهمیت پیدا می‌کند.

توسعه‌دهنده‌ای که می‌خواهد از این مدل در محصول خود استفاده کند باید میان generation و publishing مرز بگذارد. مرحله تولید می‌تواند خودکار باشد، اما انتشار، استفاده از موسیقی، تصویر افراد و ادعاهای factual به policy و بازبینی نیاز دارد. سرعت ساخت نباید چرخه حقوقی و editorial را حذف کند.

#وضعیت عرضه

Omni Flash در rollout اولیه برای مشترکان Google AI Plus، Pro و Ultra اعلام شد. این وضعیت را نباید با دسترسی آزاد API یا فعال بودن همه قابلیت‌ها در تمام کشورها یکی دانست. محصول، مدل و region ممکن است زمان‌بندی جدا داشته باشند.

Gemini Omni مسیر گوگل را از multimodal understanding به multimodal creation می‌برد. ارزش آن در ترکیب ورودی‌ها و ویرایش تعاملی است؛ محدودیتش هم همان‌جاست که در همه ابزارهای تولید ویدئو دیده می‌شود: خروجی باید از نظر پیوستگی، حقوق، provenance و معنا پیش از انتشار دیده شود.

گوگل می‌گوید ویدئوهای تولیدشده با Omni دارای واترمارک نامحسوس SynthID هستند و امکان بررسی منشأ آن‌ها در برخی محصولات گوگل فراهم می‌شود. این سازوکار به تشخیص کمک می‌کند، اما جایگزین بررسی انسانی نیست؛ تدوینگر باید بداند کدام تصویر مرجع با اجازه استفاده شده، چه تغییری روی صدا انجام گرفته و آیا مخاطب از مصنوعی بودن خروجی باخبر می‌شود.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی Anthropic برای واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی
هوش مصنوعی

واترمارک متنی Claude؛ نشانه‌گذاری آماری به‌جای ادعای تشخیص قطعی

Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر می‌ده

۲۳ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی Anthropic برای سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
هوش مصنوعی

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست

Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابی‌های امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترل‌شده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،

۸ مرداد ۱۴۰۵3 دقیقه