Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ میدهد
گوگل در ۱۹ مه ۲۰۲۶ Gemini Omni را معرفی کرد و نخستین مدل این خانواده را Omni Flash نامید. ادعای اصلی «تولید هر چیز از هر ورودی» است، اما عرضه اولیه مشخصتر است: ترکیب تصویر، صدا، ویدئو و متن برای تولید و ویرایش ویدئو. Omni Flash در Gemini app، Google Flow و Yo

Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ میدهد
گوگل در ۱۹ مه ۲۰۲۶ Gemini Omni را معرفی کرد و نخستین مدل این خانواده را Omni Flash نامید. ادعای اصلی «تولید هر چیز از هر ورودی» است، اما عرضه اولیه مشخصتر است: ترکیب تصویر، صدا، ویدئو و متن برای تولید و ویرایش ویدئو. Omni Flash در Gemini app، Google Flow و YouTube Shorts برای مشترکان Google AI Plus، Pro و Ultra در سراسر جهان rollout شد.
#از فهم تصویر تا ساخت صحنه
مدلهای قبلی Gemini میتوانستند ورودیهای چندوجهی را تحلیل کنند و Nano Banana تصویر بسازند یا ویرایش کند. Omni این دو مسیر را به تولید ویدئو نزدیک میکند. کاربر میتواند چند عکس، توضیح صوتی و متن را کنار هم بگذارد و خروجی ویدئویی بسازد که به دانش دنیای Gemini متکی باشد. سپس ویدئو با گفتوگو اصلاح شود؛ مثلاً قاب، حرکت یا عناصر یک صحنه تغییر کند.
این جریان برای creatorها جذاب است، اما consistency در ویدئو دشوارتر از یک تصویر ثابت است. هویت کاراکتر، نور، زمانبندی و رابطه علت و معلولی باید در فریمهای متعدد حفظ شود. prompt بهتر فقط بخشی از مسئله است؛ تیم تولید باید خروجی را در طول ویدئو مرور کند و خطاهای حرکتی یا محتوایی را جداگانه بررسی کند.
#Flow و YouTube Shorts
قرار گرفتن Omni Flash در Google Flow آن را به workflow ساخت ویدئو نزدیک میکند. YouTube Shorts نیز سطح توزیع است، نه صرفاً ابزار آزمایش. وقتی خروجی در پلتفرم عمومی منتشر میشود، provenance، رضایت استفاده از چهره و شفافیت درباره تولید مصنوعی اهمیت پیدا میکند.
توسعهدهندهای که میخواهد از این مدل در محصول خود استفاده کند باید میان generation و publishing مرز بگذارد. مرحله تولید میتواند خودکار باشد، اما انتشار، استفاده از موسیقی، تصویر افراد و ادعاهای factual به policy و بازبینی نیاز دارد. سرعت ساخت نباید چرخه حقوقی و editorial را حذف کند.
#وضعیت عرضه
Omni Flash در rollout اولیه برای مشترکان Google AI Plus، Pro و Ultra اعلام شد. این وضعیت را نباید با دسترسی آزاد API یا فعال بودن همه قابلیتها در تمام کشورها یکی دانست. محصول، مدل و region ممکن است زمانبندی جدا داشته باشند.
Gemini Omni مسیر گوگل را از multimodal understanding به multimodal creation میبرد. ارزش آن در ترکیب ورودیها و ویرایش تعاملی است؛ محدودیتش هم همانجاست که در همه ابزارهای تولید ویدئو دیده میشود: خروجی باید از نظر پیوستگی، حقوق، provenance و معنا پیش از انتشار دیده شود.
گوگل میگوید ویدئوهای تولیدشده با Omni دارای واترمارک نامحسوس SynthID هستند و امکان بررسی منشأ آنها در برخی محصولات گوگل فراهم میشود. این سازوکار به تشخیص کمک میکند، اما جایگزین بررسی انسانی نیست؛ تدوینگر باید بداند کدام تصویر مرجع با اجازه استفاده شده، چه تغییری روی صدا انجام گرفته و آیا مخاطب از مصنوعی بودن خروجی باخبر میشود.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

واترمارک متنی Claude؛ نشانهگذاری آماری بهجای ادعای تشخیص قطعی
Anthropic در ۱۴ اوت ۲۰۲۶ درباره سازوکار واترمارک متنی Claude توضیح داد. ایده این است که مدل در هنگام انتخاب tokenها، الگوی آماری بسیار ظریفی ایجاد کند که بعداً بتوان آن را با یک detector بررسی کرد. این روش با واترمارک تصویری که پیکسل یا metadata را تغییر میده

GPT-۵.۶ ارزانتر شد؛ Fast Mode برای کدام بار کاری است؟
اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادیتر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریعتر برای

سه حادثه سایبری Anthropic؛ چرا ارزیابی آزمایشگاهی کافی نیست
Anthropic در ۳۰ ژوئیه ۲۰۲۶ سه حادثه واقعی را در کنار ارزیابیهای امنیت سایبری خود بررسی کرد. هدف مقاله اعلام یک benchmark تازه نیست؛ نشان دادن فاصله میان محیط کنترلشده و استفاده واقعی است. مدل ممکن است در یک CTF رفتار خطرناک نشان ندهد، اما وقتی به ابزار، هدف،