پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی

برچسب

#چندوجهی

صفحه‌های برچسب برای مرور رابطه‌ی میان مقاله‌های منتشرشده ساخته شده‌اند و در این فاز noindex باقی می‌مانند.

3 مقاله منتشرشده
تصویر رسمی OpenAI برای GPT‑Live؛ بازطراحی Voice برای مکالمه‌ای که قطع نمی‌شود
هوش مصنوعی

GPT‑Live؛ بازطراحی Voice برای مکالمه‌ای که قطع نمی‌شود

OpenAI در ۸ ژوئیه ۲۰۲۶ GPT‑Live را به‌عنوان مدل تازه تجربه صوتی معرفی کرد. هدف اصلی، پاسخ سریع‌تر و طبیعی‌تر در مکالمه است؛ نه اینکه فقط متن تولیدشده با صدای مصنوعی خوانده شود. OpenAI توضیح می‌دهد که Voice قدیمی از زنجیره‌ای شامل تبدیل گفتار به متن، مدل زبانی

۱۷ تیر ۱۴۰۵3 دقیقه
تصویر رسمی Google DeepMind برای Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ می‌دهد
هوش مصنوعی

Gemini Omni؛ مدل چندوجهی که از ویدئو به ویدئو پاسخ می‌دهد

گوگل در ۱۹ مه ۲۰۲۶ Gemini Omni را معرفی کرد و نخستین مدل این خانواده را Omni Flash نامید. ادعای اصلی «تولید هر چیز از هر ورودی» است، اما عرضه اولیه مشخص‌تر است: ترکیب تصویر، صدا، ویدئو و متن برای تولید و ویرایش ویدئو. Omni Flash در Gemini app، Google Flow و Yo

۲۹ اردیبهشت ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای ChatGPT Images 2.0؛ تصویری که متن را هم جدی می‌گیرد
هوش مصنوعی

ChatGPT Images 2.0؛ تصویری که متن را هم جدی می‌گیرد

OpenAI در ۲۱ آوریل ۲۰۲۶ ChatGPT Images 2.0 را معرفی کرد؛ مدلی که ادعای اصلی‌اش فقط تصویر واقع‌گرایانه‌تر نیست. این نسخه برای کنترل دقیق‌تر، ترکیب چند ایده در یک خروجی، حفظ پیوستگی شخصیت و نمایش درست متن در تصویر طراحی شده است. از پوستر و صفحه کمیک تا اینفوگراف

۱ اردیبهشت ۱۴۰۵3 دقیقه