علیبابا مدل متنباز Qwen-Image-2.1 را برای تولید و ویرایش تصویر معرفی کرد
علیبابا مدل متنباز Qwen-Image-2.1 را با ۷ میلیارد پارامتر منتشر کرده؛ مدلی که تولید تصویر از متن و ویرایش تصویر را در یک سامانه واحد ترکیب میکند.

شرکت علیبابا مدل هوش مصنوعی Qwen-Image-2.1 را بهصورت متنباز منتشر کرده است؛ مدلی ۷ میلیارد پارامتری که تولید تصویر از متن و ویرایش تصویر را در یک مدل واحد کنار هم قرار میدهد.
یکی از قابلیتهای اصلی Qwen-Image-2.1 پشتیبانی بومی از شفافیت و لایههای RGBA است. بر اساس اطلاعات منتشرشده، این مدل میتواند تصاویر دارای پسزمینه شفاف را تولید یا ویرایش کند و در چنین تصاویری متن و عناصر مختلف را تغییر دهد یا با یکدیگر ترکیب کند.
این مدل همچنین امکان استفاده از حداکثر ۱۰ تصویر مرجع را فراهم میکند. کاربر میتواند بخش موردنظر تصویر را با ابزارهایی مانند دایره، طراحی دستی یا ماسک مشخص کند تا ویرایش دقیقتری روی همان قسمت انجام شود.
علیبابا میگوید Qwen-Image-2.1 در ویرایش پرتره و تصاویر محصولات تلاش میکند ویژگیها و جزئیات اصلی سوژه را حفظ کند. از کاربردهای اعلامشده برای این مدل میتوان به تولید تصاویر پانوراما، اینفوگرافیک، استوریبرد و تصاویر مرتبط با پرو مجازی لباس اشاره کرد.
در یکی از نمونههای ارائهشده، تصاویر یک شخصیت از سه زاویه مختلف بهعنوان مرجع استفاده شده و مدل بر اساس آنها یک استوریبرد کامل تولید کرده است. بهبود تولید بافتهای واقعگرایانه و تایپوگرافی نیز از قابلیتهایی است که درباره این مدل مطرح شده است.
Qwen-Image-2.1 از معماری Mixed-Granularity Attention استفاده میکند و با استفاده مجدد از KV Cache تلاش دارد بهرهوری فرایند استنتاج را افزایش دهد. به گفته علیبابا، این معماری بهویژه هنگام پردازش چند تصویر ورودی میتواند به کاهش هزینه محاسباتی و افزایش سرعت کمک کند.
وزنهای Qwen-Image-2.1 اکنون بهصورت متنباز در دسترس قرار گرفتهاند تا توسعهدهندگان بتوانند از این مدل برای تولید و ویرایش تصویر در پروژههای خود استفاده کنند.
مطالب مرتبط
برای ادامه مطالعه
این یادداشتها بر اساس موضوع مشترک، همپوشانی برچسبها و تازگی انتشار انتخاب میشوند.

علیبابا مدل هوش مصنوعی Damo Radar را برای تشخیص بیماریهای شکمی متنباز کرد
آکادمی DAMO علیبابا مدل Damo Radar را متنباز کرده است؛ مدلی که برای شناسایی نزدیک به ۱۵۰ بیماری شکمی از تصاویر سیتیاسکن طراحی شده است.

نگرانی سیلیکونولی از ایجنتهای هوش مصنوعی؛ از مسئله همسوسازی تا کلید قطع اضطراری
گزارشی از دیجیاتو میگوید نگرانی درباره ایجنتهای هوش مصنوعی از آینده مشاغل فراتر رفته و به خطرهای همسوسازی، رفتارهای پیشبینینشده و رقابت شرکتها رسیده است.

گوگل نسل جدید مدلهای صوتی Gemini را معرفی کرد
گوگل دو مدل صوتی جدید Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking را معرفی کرده که برای پاسخگویی سریع و انجام کارهای پیچیده چندمرحلهای طراحی شدهاند.
دیدگاهها
اولین نفری باش که دیدگاه میذاره