بررسی Hy4 preview؛ مدل ۷۷۰ میلیارد پارامتری تنسنت چقدر قدرتمند است؟

بررسی Hy4 preview؛ مدل ۷۷۰ میلیارد پارامتری تنسنت چقدر
قدرتمند است؟
هولدینگ چینی تنسنت (Tencent) با معرفی مدل متنباز Hy4 preview بار دیگر نشان داد رقابت در دنیای مدلهای وزنباز فقط به چند شرکت آمریکایی محدود نیست. این مدل از همان روزهای نخست انتشار، با ادعاهای قابلتوجهی درباره توانایی در کدنویسی، انجام وظایف چندمرحلهای و کار با ابزارها توجه توسعهدهندگان را جلب کرده است.
اما در مورد مدلی که بخش زیادی از نتایج اولیهاش از سوی خود سازنده منتشر شده، فاصله میان ادعا و عملکرد واقعی اهمیت زیادی دارد. آیا Hy4 preview واقعاً میتواند با مدلهای متنباز دیگری مانند Kimi K3 و GLM 5.3 رقابت کند؟ تجربه کاربران از آن چگونه بوده و آیا مزیتهایش ارزش سختافزار و هزینه اجرای آن را دارد؟
-
Hy4 preview چیست و چرا مهم است؟
-
مشخصات فنی Hy4 preview
-
کانتکست یکمیلیونتوکنی Hy4 چه کاربردی دارد؟
-
Hy4 preview برای چه کارهایی ساخته شده است؟
-
Hy4 preview چقدر قدرتمند است؟
-
Hy4 در مقایسه با Hy3
-
Hy4 در برابر رقبای اصلی
-
Hy4 در برابر GLM 5.3 و Kimi K3
-
ارزیابیهای مستقلتر چه میگویند؟
-
محدودیتهای Hy4 preview و تجربههای اولیه کاربران
-
قیمت و نحوه دسترسی به Hy4 preview
-
آیا Hy4 preview ارزش بررسی دارد؟
در این بررسی، عملکرد Hy4 preview، تفاوت آن با نسل قبل، نتایج مقایسه با رقبا، تجربههای اولیه کاربران و محدودیتهای این مدل را بررسی میکنیم تا ببینیم تازهوارد بزرگ تنسنت واقعاً چه جایگاهی در میان مدلهای قدرتمند وزنباز دارد.
Hy4 preview چیست و چرا مهم است؟
شرکت تنسنت، غول فناوری چینی، در ۲۸ آگوست ۲۰۲۶ از نسخه Hy4 preview پرده برداشت و آن را نسل تازهای از مدلهای تیم Tencent Hy در خانواده Hunyuan معرفی کرد.
Hy4 از معماری Mixture of Experts یا MoE استفاده میکند و backbone یا بدنه اصلی مدل در مجموع ۷۷۰ میلیارد پارامتر دارد؛ بااینحال، در پردازش هر توکن فقط ۴۹ میلیارد پارامتر فعال میشود. مدل ۷۸ لایه دارد که لایه اول آن FFN متراکم (Dense) است و ۷۷ لایه بعدی از ساختار MoE استفاده میکنند. هرکدام از این لایهها ۲۵۶ متخصص مسیریابیشده (routed expert) و یک متخصص مشترک (shared expert) دارند.
برای پردازش هر توکن، مدل ۸ متخصص از میان ۲۵۶ متخصص مسیریابیشده را انتخاب میکند و در کنار آن، متخصص اشتراکی را نیز فعال نگه میدارد. به این ترتیب، مدل ظرفیت بسیار بزرگی در اختیار دارد، اما برای پردازش هر توکن مجبور نیست تمام پارامترهای خود را فعال کند.
|
ویژگی |
مشخصات |
متخصصهای مسیریابیشده |
۲۵۶ مورد در هر لایه MoE |
|---|---|
|
متخصص مشترک |
یک مورد |
|
متخصصهای فعال برای هر توکن |
۸ متخصص مسیریابیشده + ۱ متخصص مشترک |
این معماری باعث میشود Hy4 از نظر ظرفیت بسیار بزرگ باشد، بدون اینکه در هر مرحله محاسباتی تمام پارامترهای مدل فعال شوند. بااینحال، «۴۹ میلیارد پارامتر فعال» به این معنا نیست که مدل از نظر حافظه شبیه یک مدل متراکم با ۴۹ میلیارد پارامتر است؛ وزنهای تمام متخصصها همچنان باید در حافظه سیستم یا زیرساخت استقرار مدل نگهداری شوند.
Hy4 علاوه بر بدنه اصلی، یک لایه Multi-Token Prediction یا MTP با ۱۰ میلیارد پارامتر دارد که حدود ۰٫۷ میلیارد پارامتر آن برای هر توکن فعال میشود.
این بخش برای speculative decoding به کار میرود تا مدل بتواند چند توکن احتمالی آینده را زودتر پیشبینی کند و در صورت تأیید، فرایند تولید پاسخ را سریعتر پیش ببرد.
مشخصات فنی Hy4 preview
|
ویژگی |
مشخصات |
معماری |
Mixture of Experts (MoE) |
|---|---|
|
پارامترهای backbone |
۷۷۰ میلیارد |
|
پارامترهای فعال |
۴۹ میلیارد |
|
تعداد لایهها |
۷۸ |
|
Routed expertها |
۲۵۶ در هر لایه MoE |
|
Shared expert |
یک مورد |
|
Expertهای فعال برای هر توکن |
۸ routed + یک shared |
|
MTP |
۱۰ میلیارد پارامتر کل، ۰٫۷ میلیارد فعال |
|
Attention |
Gated DeepSeek Sparse Attention |
|
Context window |
۱٬۰۴۸٬۵۷۶ توکن |
|
لایسنس |
Apache 2.0 |
تنسنت در بخش attention از Gated DeepSeek Sparse Attention یا Gated DSA استفاده کرده و برای استفاده مجدد از شاخصهای sparse attention بین لایهها، فناوری IndexCache را به کار گرفته است. مسیر residual نیز از identity Hyper-Connections یا iHC استفاده میکند.
اندازه Hy4 اجرای محلی نسخه کامل را برای بیشتر کاربران عادی غیرعملی میکند
وزنهای Hy4 preview و نسخه FP8 آن بهصورت عمومی منتشر شدهاند و مدل تحت مجوز Apache 2.0 ارائه شده است. نسخه مدل در Hugging Face نیز در دسترس قرار دارد و امکان استفاده از ابزارهایی مانند Transformers، vLLM و SGLang برای اجرای آن فراهم شده است.
اندازه مدل اجرای محلی نسخه کامل را برای بیشتر کاربران عادی غیرعملی میکند. مخزن Hugging Face حجم حدود ۱٫۵۶ ترابایت را برای فایلهای مدل نشان میدهد؛ هرچند نسخههای FP8 و روشهای کوانتایزیشن میتوانند نیاز سختافزاری را کاهش دهند.
کانتکست یکمیلیونتوکنی Hy4 چه کاربردی دارد؟
یکی از مهمترین ویژگیهای Hy4 preview، پنجره زمینه ۱٬۰۴۸٬۵۷۶ توکنی آن است؛ یعنی مدل میتواند در یک نشست تقریباً یک میلیون توکن را در اختیار داشته باشد. این ظرفیت برای کارهایی مانند بررسی مخازن بزرگ کد، تحلیل مجموعهای از اسناد، پژوهش روی منابع طولانی و انجام وظایف چندمرحلهای اهمیت دارد.
ظرفیت کانتکست با کیفیت استفاده از آن یکی نیست
بااینحال، ظرفیت کانتکست را نباید با کیفیت استفاده از آن یکی دانست. اینکه یک مدل بتواند یک میلیون توکن را دریافت کند، بهخودیخود نشان نمیدهد که در سراسر این پنجره میتواند اطلاعات مرتبط را با دقت یکسان بازیابی کند یا در حداکثر طول کانتکست همچنان سرعت و هزینه مناسبی داشته باشد. چنین مواردی به آزمونهای کنترلشده نیاز دارند.
فناوریهای Hy4 برای پردازش کانتکست طولانی
تنسنت برای مدیریت محاسبات مربوط به کانتکست طولانی از Gated DSA و IndexCache استفاده کرده است؛ اولی sparse attention را ممکن میکند و دومی امکان بازاستفاده از شاخصهای sparse را در لایههای مختلف فراهم میکند.
به زبان ساده در روش Gated DeepSeek Sparse Attention یا Gated DSA، مدل ابتدا بخشهای مهمتر متن را پیدا میکند و بیشتر روی همان بخشها تمرکز میکند. این کار باعث میشود محاسبات کمتری انجام شود و پاسخگویی مدل سریعتر و ارزانتر باشد.
تنسنت برای جلوگیری از محاسبهی دوبارهی این بخشهای مهم از IndexCache استفاده میکند. مدل اطلاعات مربوط به بخشهایی را که قبلاً مهم تشخیص داده شدهاند ذخیره میکند و در مراحل بعد دوباره از همان اطلاعات استفاده میکند. بنابراین لازم نیست هر بار از ابتدا مشخص کند کدام قسمتهای متن مهم هستند.
این مدل همچنین از روشی به نام Identity Hyper-Connections یا iHC در مسیر انتقال اطلاعات بین لایهها استفاده میکند. این روش کمک میکند اطلاعات هنگام عبور از لایههای مختلف کمتر از بین بروند و ارتباط بین بخشهای مختلف مدل بهتر حفظ شود.
Hy4 preview برای چه کارهایی ساخته شده است؟
تمرکز Hy4 بیشتر از یک چتبات عمومی، روی کارهای حرفهای و چندمرحلهای است. تنسنت میگوید مدل با همکاری متخصصان داخلی این شرکت در حوزههایی مانند مهندسی نرمافزار، توسعه بازی، امور مالی و امنیت آموزش و ارزیابی شده است. در نتیجه، کاربردهای اصلی آن شامل موارد زیر است:
تمرکز Hy4 بیشتر از یک چتبات عمومی، روی کارهای حرفهای و چندمرحلهای است
- برنامهنویسی، دیباگ و توسعه نرمافزار
- انجام وظایف طولانیمدت مهندسی نرمافزار
- استفاده از ابزارها و اجرای ورکفلوهای عاملمحور
- تحلیل داده و اسناد
- ساخت فایلهای اداری مانند سند، اسپردشیت و ارائه
- توسعه بازی
- پژوهش علمی و حل مسائل پیچیده
تنسنت همچنین به بهبود عملکرد مدل در کارهای فرانتاند و تعاملات چندمرحلهای اشاره کرده است.
















