اشتراک
هوش مصنوعی یادگیری ماشین فناوری

کوانتیزاسیون دینامیک Unsloth v3.0 GGUF

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

نسخه ۳.۰ کوانتیزاسیون دینامیک Unsloth، پیشرفتی چشمگیر نسبت به نسخه‌های پیشین است که با استفاده از متدولوژی جدید و مجموعه داده کالیبراسیون imatrix با کیفیت بالا، دقتی بیش از ۱۰ درصد بالاتر را در همان حجم ارائه می‌دهد. این به‌روزرسانی که شامل بهینه‌سازی انتخاب لایه‌ها و تکنیک‌های پیشرفته کوانتیزاسیون پس از آموزش (PTQ) است، بدون استفاده از روش‌های پرخطر مانند QAT یا QAD، کیفیت مدل‌ها را در بارهای کاری واقعی حفظ می‌کند. نسخه‌های جدید با اکثر موتورهای استنتاجی مانند llama.cpp و Unsloth Desktop سازگار بوده و با تمرکز بر معیارهایی نظیر Divergence-300 و KL Divergence، به طور مؤثر از بیش‌برازش (Overfitting) جلوگیری می‌کنند. در این نسخه، ماژول‌های MTP در مدل‌های کوچک‌تر حذف شده و کوانت‌های ۱-بیتی جدیدی برای بهره‌وری بیشتر معرفی شده‌اند. با این حال، توسعه‌دهندگان باید توجه داشته باشند که مدل‌های ۱-بیتی برای کاربردهای عامل‌محور (Agentic) و فراخوانی ابزار مناسب نیستند و بهتر است برای این موارد از کوانت‌های قوی‌تر استفاده شود. Unsloth همچنین با همکاری مستقیم با تیم‌های بزرگی چون متا، گوگل و مایکروسافت، نقش فعالی در رفع اشکالات مدل‌های پایه ایفا می‌کند تا کارایی و دقت مدل‌های کوانتیزه شده را به حداکثر برساند. در نهایت، با استفاده از روش‌های ارزیابی سخت‌گیرانه و کنترل نشت داده‌ها، اطمینان حاصل شده است که کوانت‌های ارائه شده، بر خلاف بسیاری از روش‌های موجود، دچار بیش‌برازش نشده و عملکرد قابل اعتمادی در کاربردهای دنیای واقعی دارند.

Unsloth Dynamic v3.0 نسل بعدی کوانتیزاسیون دینامیک ما و بهبود عمده‌ای نسبت به Dynamic v2.0 است.

امروز، ما کوانت‌های Dynamic v3.0 Qwen3.8-27B را منتشر می‌کنیم که در مقایسه با سایر ارائه‌دهندگان، بیش از ۱۰٪ دقت برتر در ۱٪ برتر را در همان اندازه ارائه می‌دهند. این یک به‌روزرسانی از نسخه پیش‌نمایش اولیه Dynamic v3.0 است که قبلاً به اشتراک گذاشته بودیم. GGUFهای جدید ۳.۰ با اکثر موتورهای استنتاجی از جمله llama.cpp و Unsloth Desktop کار می‌کنند.

Dynamic v3.0 به طور کلی کیفیت مدل را با حفظ همان اندازه، با نتایج قوی‌تر در معیارهایی مانند Divergence-300 @32 و KL Divergence، بیشتر حفظ می‌کند.

همچنین از حمایت بی‌دریغ شما بسیار سپاسگزاریم! ما در تنها ۵ روز بیش از ۵.۱ میلیون دانلود Unsloth Qwen3.8 را شاهد بودیم!

متدولوژی جدید ما از بسیاری ویژگی‌ها و بهبودهای جدید تشکیل شده است. اکنون از یک مجموعه داده کالیبراسیون imatrix با کیفیت بسیار بالاتر از منابع متنوع استفاده می‌کنیم. این مجموعه داده برای کدنویسی عامل‌محور (agentic coding)، چت و عملکرد چندزبانه بهینه‌سازی شده است. همچنین انتخاب لایه را بهبود بخشیده‌ایم و تکنیک‌های کوانتیزاسیون بیشتری را برای حفظ حداکثر کیفیت مدل معرفی کرده‌ایم.

ما روی مجموعه داده کالیبراسیون imatrix آموزش نمی‌دهیم و از QAT یا QAD استفاده نمی‌کنیم. همه چیز از طریق کوانتیزاسیون پس از آموزش (post-training quantization) انجام می‌شود. فایل imatrix مورد استفاده ما برای آزمایش، ارزیابی و استفاده جامعه در دسترس است. ما محققان و توسعه‌دهندگان را تشویق می‌کنیم تا با استفاده از کوانت‌ها/imatrix Unsloth ما، تغییرات و تنظیمات دقیق Qwen3.8 را ایجاد کنند. همچنین می‌توانید تحلیل بیش‌برازش (overfitting) ما را مطالعه کنید.

,
تولید شده با یک GGUF دو بیتی Qwen3.8-27B
  • ما همچنین ماژول MTP را از کوانت‌های کوچک‌تر زیر UD-Q2_K_XL (۸.۳۷ گیگابایت و کمتر) حذف کردیم تا حدود ۵۰۰ مگابایت فضای دیسک را حفظ کنیم – در صورت نیاز می‌توانید از ماژول جداگانه Q4_0 MTP استفاده کنید.
  • ما همچنین برخی کوانت‌های ۱ بیتی UD کوچک‌تر را با UD-IQ1_S به حجم ۶.۲ گیگابایت (بدون MTP) ایجاد کردیم که حدود ۷۲٪ دقت ۱٪ برتر را حفظ می‌کنند، در حالی که ۸۹٪ کوچک‌تر هستند.
  • UD-Q2_K_XL حدود ۸٪ دقیق‌تر در ۱٪ برتر نسبت به بهترین مدل بعدی است و ۹.۸۳ گیگابایت حجم دارد و توانست یک برنامه HTML کارآمد با ۱ اشکال کوچک جاوا اسکریپت ایجاد کند – قبلاً این کار باعث خرابی می‌شد.

?? Divergence-300 @32

ما معمولاً دقت ۱٪ برتر را گزارش می‌کنیم، همانطور که برای Kimi-K3 «دینامیک ۱ بیتی به ~۷۸.۹٪ دقت ۱٪ برتر می‌رسد در حالی که ۶۲٪ کوچک‌تر است.» با این حال، ۱٪ برتر یک آرگ‌مکس (argmax) بر روی ۱ پیش‌بینی است، بنابراین در سنجش استنتاج واقعی چندان مؤثر نیست.

ما یک مجموعه داده از ۳۰۰ مثال نگه‌داشته شده (که در مجموعه داده کالیبراسیون نیستند) از Terminal-Bench 2.1 + DeepSWE + Harbor + MathArena 2025-26 + پرامپت‌های غیرلاتین/اسناد طولانی ایجاد کردیم و رمزگشایی حریصانه آرگ‌مکس را برای ۳۲ توکن برای BF16 در مقابل همه کوانت‌ها و ارائه‌دهندگان انجام دادیم. برای جزئیات بیشتر در مورد بیش‌برازش، به تحلیل بیش‌برازش مراجعه کنید.

این به ما امکان می‌دهد تا بررسی کنیم که آیا بیش‌برازش وجود دارد و آیا خروجی‌های کوانت مشابه مسیرهای BF16 در طول چندین توکن هستند یا خیر. این یک معیار بهتر از دقت ۱٪ برتر است، زیرا ما KLD ۱٪ برتر را به KLD ۱٪ برتر در ۳۲ توکن گسترش می‌دهیم.

? ۱-بیت نباید برای موارد استفاده عامل‌محور (agentic) استفاده شود

همانطور که در ?? Divergence-300 @32 مشاهده می‌شود، افت شدیدی از UD-Q2_K_XL به UD-IQ2_S برای پیش‌بینی ۳۲ توکن از حدود ۲۵٪ دقت به کمتر از ۸-۱۰٪ وجود دارد. این افت شدید به این معنی است که فراخوانی ابزار (tool calling) و حالت‌های بدون تفکر از کار می‌افتند. برخی از مسائل و راه‌حل‌ها در صورت استفاده از ۱-بیت:

  1. حلقه‌های بیش از حد: هنگام استفاده از کوانت‌های زیر UD-Q2_K_XL، حلقه‌های زیادی را مشاهده خواهید کرد – در همه موارد از presence_penalty = 1.5 (یا بالاتر) استفاده کنید.
  2. پاسخ‌های خالی: همیشه تفکر را حداقل در استدلال پایین برای کوانت‌های ۱-بیتی فعال کنید – حالت‌های بدون استدلال باعث می‌شوند مدل حتی خروجی هم ندهد.
  3. موارد استفاده عامل‌محور و فراخوانی ابزار: از مدل برای فراخوانی ابزار استفاده نکنید – تنها دانش عمومی حفظ می‌شود وقتی به شدت کوانتیزه شود، و مدل یا در فراخوانی ابزار شکست می‌خورد، یا به فراخوانی ابزار ادامه می‌دهد یا حتی آنها را فراخوانی نمی‌کند.
  4. دانش عمومی کار می‌کند: بازیابی ۷۷٪ در ۱٪ برتر جایگزینی برای Divergence-300 @32 با ۸٪ نیست که شاخص بهتری برای بارهای کاری استنتاج واقعی است – می‌توانید از مدل برای سؤالات واقعیت‌محور دانش عمومی بسیار کوتاه استفاده کنید، اما بهتر است از UD-Q2_K_XL استفاده کنید.

?? معیارهای KL Divergence

ما معیارهای KLD را برای همه ارائه‌دهندگان نیز اجرا کردیم و میانگین ۱٪ برتر و KLD را گزارش می‌دهیم. در همه سطوح، به خصوص در اندازه‌های کوانت کوچک‌تر، کوانت‌های Unsloth UD-3 تا ۱۰٪ دقت ۱٪ برتر اضافی را در همان فضای دیسک به دست می‌آورند!

همه نمودارها، سر MTP را از محور x هنگام محاسبه فضای دیسک حذف می‌کنند تا مقایسه عادلانه‌ای با همه ارائه شود.

??? عدم بیش‌برازش

هنگام مقایسه با UD-2 قدیمی‌تر ما در Wikitext و Code دیده نشده، بهبود زیادی در KLD نشان می‌دهیم – در مدل‌های بزرگ‌تر اینقدر زیاد نیست، بنابراین ما همچنان از UD-2 قدیمی خود برای کوانت‌های بزرگ‌تر استفاده می‌کنیم – قصد داریم آنها را نیز آزمایش و بهبود بخشیم!

ما همچنین با استفاده از مجموعه داده‌های کاملاً متفاوت برای کالیبراسیون و حذف حداکثر نشت‌ها، بیش‌برازش را کنترل می‌کنیم. ما KLD را روی این مجموعه داده‌های دیده نشده آزمایش می‌کنیم و همچنین QAD / QAT انجام نمی‌دهیم، فقط PTQ خالص، بنابراین بیش‌برازش کمتر از رویکردهای QAD / QAT دیگر نگران‌کننده است.

به طور مشابه، ?? Divergence-300 @32 از یک مجموعه داده دیده نشده شامل ۳۰۰ پرامپت از DeepSWE، Terminal Bench و سایر موارد استفاده می‌کند و به عنوان یک مجموعه داده دیگر برای سنجش بیش‌برازش عمل می‌کند – و نشان می‌دهد که روش‌های جدید UD-3 ما بیش‌برازش ندارند.

Dynamic v2.0 (قدیمی)

ما کوانتیزاسیون Dynamic v2.0 Unsloth را معرفی می‌کنیم – یک ارتقاء عمده برای کوانت‌های قبلی ما. این روش جدید از روش‌های کوانتیزاسیون پیشرو بهتر عمل می‌کند و معیارهای جدیدی را برای Aider Polyglot، MMLU 5-شات و KL Divergence تعیین می‌کند.

این بدان معناست که اکنون می‌توانید LLMهای کوانتیزه شده را اجرا و تنظیم دقیق کنید و در عین حال حداکثر دقت را حفظ کنید! می‌توانید GGUFهای ۲.۰ را روی اکثر موتورهای استنتاجی مانند llama.cpp، Unsloth Studio و غیره اجرا کنید.

,
معیارهای Gemma 4 26B A4B (کمتر بهتر است)
,
معیارهای Qwen3.6 (کمتر بهتر است)

به‌روزرسانی ۲۰ آوریل ۲۰۲۶: معیارهای GGUF جدید ما را برای Qwen3.6 و Gemma 4 ببینید.

به‌روزرسانی ۲۷ فوریه ۲۰۲۶: Qwen3.5 منتشر شد و ما برخی از مشکلات قالب چت فراخوانی ابزار را برطرف کردیم و هر GGUF را بر اساس سردرگمی (perplexity) و KL Divergence محک زدیم. معیارها را ببینید!

مزیت کلیدی استفاده از بسته Unsloth و کوانت‌ها، نقش فعال ما در رفع اشکالات در مدل‌های اصلی است. ما مستقیماً با تیم‌های پشت Qwen3، متا (Llama 4)، میسترال (Devstral)، گوگل (Gemma 1–3) و مایکروسافت (Phi-3/4) همکاری کرده‌ایم و به رفع اشکالاتی کمک کرده‌ایم که دقت را افزایش می‌دهند.

GGUFهای دینامیک Unsloth اکنون می‌توانند در Unsloth Studio اجرا شوند ?

به‌روزرسانی ۱۰ سپتامبر ۲۰۲۵: شما معیارهای سخت‌تری درخواست کردید، بنابراین نتایج Aider Polyglot در اینجا آمده است! GGUF سه بیتی دینامیک DeepSeek V3.1 ما ۷۵.۶٪ امتیاز کسب می‌کند که از بسیاری از LLMهای SOTA با دقت کامل پیشی می‌گیرد. بیشتر بخوانید.

معیارهای تفکر Aider DeepSeek-V3.2معیارهای MMLU 5-شات Llama 4

همچنین می‌توانید معیارهای کاربردی واقعی را که توسط بنجامین ماری (Benjamin Marie) برای LiveCodeBench v6، MMLU Pro و غیره انجام شده است، مشاهده کنید:

می‌توانید ببینید که چگونه GGUFهای Unsloth با وجود اینکه حدود ۸ گیگابایت کوچک‌تر هستند، بهتر از کوانت‌های غیر Unsloth عمل می‌کنند.

تحلیل دقیق معیارهای ما و ارزیابی در ادامه آمده است.

?? چه چیز جدیدی در Dynamic v2.0 وجود دارد؟

  • انتخاب لایه بازنگری شده برای GGUFها + safetensors: Unsloth Dynamic 2.0 اکنون لایه‌ها را به صورت انتخابی بسیار هوشمندانه‌تر و گسترده‌تر کوانتیزه می‌کند. به جای تغییر تنها لایه‌های منتخب، اکنون نوع کوانتیزاسیون هر لایه ممکن را به صورت دینامیک تنظیم می‌کنیم و ترکیب‌ها برای هر لایه و مدل متفاوت خواهد بود.
  • GGUFهای انتخاب شده فعلی و همه آپلودهای آینده از Dynamic 2.0 و مجموعه داده کالیبراسیون جدید ما استفاده خواهند کرد. این مجموعه داده حاوی بیش از ۱.۵ میلیون توکن (بسته به مدل) است و از داده‌های با کیفیت بالا، دست‌چین شده و تمیز تشکیل شده است – برای افزایش چشمگیر عملکرد چت مکالمه‌ای.
  • قبلاً، کوانتیزاسیون دینامیک ما (DeepSeek-R1 1.58-bit GGUF) تنها برای معماری‌های MoE مؤثر بود. کوانتیزاسیون Dynamic 2.0 اکنون روی همه مدل‌ها (از جمله MOEها و غیر MoEها) کار می‌کند.
  • کوانت‌های خاص مدل: هر مدل اکنون از یک طرح کوانتیزاسیون سفارشی استفاده می‌کند. به عنوان مثال، لایه‌های کوانتیزه شده در Gemma 3 به طور قابل توجهی با لایه‌های Llama 4 متفاوت است.
  • برای به حداکثر رساندن کارایی، به ویژه در دستگاه‌های Apple Silicon و ARM، اکنون فرمت‌های Q4_NL، Q5.1، Q5.0، Q4.1 و Q4.0 را نیز اضافه می‌کنیم.

برای اطمینان از معیارگیری دقیق، ما یک چارچوب ارزیابی داخلی برای مطابقت با امتیازات رسمی MMLU 5-شات گزارش شده Llama 4 و Gemma 3 ساختیم. این امکان مقایسه مستقیم بین دقت کامل در مقابل Dynamic v2.0، QAT و کوانت‌های GGUF imatrix استاندارد را فراهم کرد.

همه آپلودهای GGUF آینده از Unsloth Dynamic 2.0 استفاده خواهند کرد و کوانت‌های ۴ بیتی دینامیک safe tensor ما نیز در آینده از این مزیت بهره‌مند خواهند شد.

?? چرا KL Divergence؟

«دقت تنها چیزی نیست که نیاز دارید» نشان می‌دهد که چگونه هرس کردن لایه‌ها، حتی با انتخاب لایه‌های غیرضروری، همچنان تفاوت‌های زیادی را از نظر «برگشت» (flips) ایجاد می‌کند. «برگشت» به عنوان تغییر پاسخ‌ها از نادرست به صحیح یا بالعکس تعریف می‌شود. این مقاله نشان می‌دهد که چگونه MMLU ممکن است با هرس کردن لایه‌ها یا انجام کوانتیزاسیون کاهش نیابد، اما این به دلیل این است که برخی از پاسخ‌های نادرست ممکن است «برگشته» و صحیح شده باشند. هدف ما مطابقت با مدل اصلی است، بنابراین اندازه‌گیری «برگشت‌ها» یک معیار خوب است.

KL Divergence باید یکی از استانداردهای طلایی برای گزارش خطاهای کوانتیزاسیون باشد، همانطور که در مقاله تحقیقاتی «دقت تنها چیزی نیست که نیاز دارید» آمده است. استفاده از سردرگمی (perplexity) نادرست است زیرا مقادیر توکن خروجی می‌توانند یکدیگر را خنثی کنند، بنابراین ما باید از KLD یا معیارهای سخت‌تری مانند Aider استفاده کنیم.

این مقاله همچنین نشان می‌دهد که به طور جالب توجهی KL Divergence با برگشت‌ها (flips) همبستگی بالایی دارد، و بنابراین هدف ما کاهش میانگین KL Divergence در حالی است که فضای دیسک کوانتیزاسیون را تا حد امکان کمتر افزایش دهیم.

?? بیش‌برازش مجموعه داده کالیبراسیون

اکثر چارچوب‌ها سردرگمی (perplexity) و KL Divergence را با استفاده از یک مجموعه آزمایشی از مقالات ویکی‌پدیا گزارش می‌دهند. با این حال، ما متوجه شدیم که استفاده از مجموعه داده کالیبراسیون که مربوط به ویکی‌پدیا نیز هست، باعث بیش‌برازش کوانت‌ها و دستیابی به امتیازات سردرگمی پایین‌تر می‌شود. ما از Calibration_v3 و Calibration_v5 برای آزمایش عادلانه استفاده می‌کنیم که شامل برخی داده‌های wikitext در میان سایر داده‌ها است. همچنین مدل‌های دستورالعمل (instruct models) دارای قالب‌های چت منحصر به فردی هستند و استفاده از مجموعه داده‌های کالیبراسیون فقط متنی برای مدل‌های دستورالعمل مؤثر نیست (برای مدل‌های پایه بله). در واقع، اکثر GGUFهای imatrix معمولاً با این مسائل کالیبره می‌شوند. در نتیجه، آنها به طور طبیعی در معیارهای KL Divergence که از داده‌های ویکی‌پدیا نیز استفاده می‌کنند، عملکرد بهتری دارند، زیرا مدل اساساً برای آن دامنه بهینه‌سازی شده است.

برای اطمینان از ارزیابی عادلانه و کنترل شده، ما از مجموعه داده کالیبراسیون خود (که برای عملکرد چت بهینه‌سازی شده است) هنگام معیارگیری KL Divergence استفاده نمی‌کنیم. در عوض، ما آزمایش‌ها را با استفاده از همان مجموعه داده‌های استاندارد ویکی‌پدیا انجام دادیم، که به ما امکان می‌دهد عملکرد روش Dynamic 2.0 خود را مستقیماً با رویکرد پایه imatrix مقایسه کنیم.

?? ماجرای تکرار MMLU

,
مسائل پیاده‌سازی MMLU
  • تکرار MMLU 5-شات کابوس‌وار بود. ما نتوانستیم نتایج MMLU را برای بسیاری از مدل‌ها از جمله Llama 3.1 (8B) Instruct، Gemma 3 (12B) و دیگران به دلیل مسائل ظریف پیاده‌سازی تکرار کنیم. به عنوان مثال، Llama 3.1 (8B) باید حدود ۶۸.۲٪ به دست آورد، در حالی که با استفاده از پیاده‌سازی‌های نادرست می‌تواند ۳۵٪ دقت به دست آورد.
  • Llama 3.1 (8B) Instruct با استفاده از یک پیاده‌سازی ساده MMLU، دقت MMLU 5-شات ۶۷.۸٪ دارد. با این حال، ما متوجه شدیم که Llama
اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: unsloth.ai