به گزارش سیتنا، شرکت چینی علیبابا روز دوشنبه از بزرگترین و توانمندترین مدل هوش مصنوعی خود با نام Qwen3.8-Max رونمایی کرد؛ مدلی که از نظر اندازه فاصله چندانی با Kimi K3، محصول شرکت رقیب Moonshot AI که ماه گذشته معرفی شد، ندارد.
شرکتهای فناوری چین که از بازیگران اصلی توسعه مدلهای متنباز (Open-weight) هوش مصنوعی در جهان به شمار میروند، در رقابتی فشرده و پرشتاب تلاش میکنند مدلهایی قدرتمندتر توسعه دهند، بدون آنکه هزینه اجرای آنها به شکل چشمگیری افزایش یابد.
مدل Qwen3.8-Max دارای ۲.۴ تریلیون پارامتر است؛ پارامترها مقادیر عددیای هستند که مدل در جریان آموزش از دادهها فرا میگیرد و از آنها برای شناسایی الگوها، تولید پاسخ و انجام وظایف مختلف استفاده میکند. در مقابل، مدل Kimi K3 شرکت Moonshot AI از ۲.۸ تریلیون پارامتر بهره میبرد.
البته تعداد بیشتر پارامترها لزوماً به معنای عملکرد بهتر یک مدل نیست، اما این شاخص به یکی از مهمترین معیارهای سنجش مقیاس پردازشی و حجم داده مورد استفاده در مدلهای پیشرفته هوش مصنوعی تبدیل شده است.
شرکتهای فناوری چینی معمولاً تعداد پارامترهای مدلهای خود را منتشر میکنند تا اعتماد و استقبال توسعهدهندگان را جلب کنند. بیشتر این مدلها از نوع Open-weight هستند؛ به این معنا که وزنهای آموزشدیده مدل در اختیار توسعهدهندگان قرار میگیرد تا بتوانند آن را اجرا، شخصیسازی یا برای کاربردهای مختلف توسعه دهند.
در مقابل، شرکتهایی مانند OpenAI، Anthropic و گوگل تعداد پارامترهای مدلهای متنبسته (Closed-source) خود را منتشر نمیکنند. مدل Qwen3.8-Max همزمان با معرفی در پلتفرم مقایسه مدلهای هوش مصنوعی Arena.AI، به رتبه نخست مدلهای چینی در بخش پردازش متن دست یافت. با این حال، همچنان پایینتر از Claude Fable 5 و سه نسخه مختلف Claude Opus متعلق به شرکت Anthropic قرار دارد.
در بخش تحلیل تصاویر و محتوای بصری نیز این مدل موفق شد رتبه دوم جهان را کسب کند و تنها نسخهای از Claude Fable 5 عملکرد بهتری از آن ثبت کرده است. هم Qwen3.8-Max و هم Kimi K3 قادر به پردازش همزمان متن، تصویر و ویدئو هستند و از پنجره زمینه (Context Window) یک میلیون توکنی پشتیبانی میکنند.
توکنها واحدهای کوچکی از داده هستند که معمولاً شامل بخشی از یک واژه یا یک کلمه کامل میشوند. هرچه ظرفیت پردازش توکن بیشتر باشد، مدل میتواند حجم بیشتری از اطلاعات، مانند پروندههای حقوقی طولانی، مخازن بزرگ کد نرمافزاری یا صدها صفحه سند را بهصورت همزمان تحلیل کند.
علیبابا اعلام کرده است که این مدل از معماری Mixture of Experts (ترکیب خبرگان) بهره میبرد؛ معماریای که به جای فعال کردن کل مدل برای هر درخواست، تنها بخشهای تخصصی مورد نیاز را فعال میکند. به همین دلیل، اگرچه مدل در مجموع ۲.۴ تریلیون پارامتر دارد، اما در هر بار پردازش تنها ۹۵ میلیارد پارامتر فعال میشود که این موضوع هزینه محاسباتی و زمان پاسخدهی را به میزان قابل توجهی کاهش میدهد.
این شرکت همچنین اعلام کرد Qwen3.8-Max توانسته یک پروژه مهندسی نرمافزار را طی ۱۶ روز به پایان برساند؛ موضوعی که به گفته علیبابا نشاندهنده توانایی بالای این مدل در انجام وظایف پیچیده برنامهنویسی است.
قرار است Qwen3.8-Max از هفته آینده از طریق پلتفرم Alibaba Cloud Model Studio در اختیار کاربران و توسعهدهندگان قرار گیرد.
انتهای پیام