اشتراک
فناوری هوش مصنوعی مهندسی نرم‌افزار

کیمی K3 با فیبل رقابت می‌کند؛ کیمی K3 + فیبل پیشرفته‌ترین مدل موجود است

K3 یک مدل خوب است

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

مدل هوش مصنوعی کیمی K3 به عنوان یک مدل متن‌باز با کیفیت پیشرو، رقیبی جدی برای فیبل ۵ محسوب می‌شود و ترکیبی از کارایی و هزینه بهینه را ارائه می‌دهد. بررسی‌ها بر روی بیش از ۱۰۰۰ وظیفه عامل‌محور نشان می‌دهد که مسیریابی هوشمند بین این دو مدل، نه تنها امکان دستیابی به دقت ۹۳ درصدی را فراهم می‌کند، بلکه می‌تواند هزینه‌ها را تا ۵۰ برابر نسبت به استفاده انحصاری از فیبل کاهش دهد. اگرچه هر دو مدل از نظر عملکرد کلی در بنچمارک‌های اصلی مانند SWE مشابه هستند، اما تخصص‌های متفاوتی دارند؛ به طوری که کیمی K3 در حوزه‌هایی نظیر ریاضیات نمادین، ابزارهای توسعه و عملیات پیچیده ترمینال نظیر امنیت و رمزنگاری برتری دارد، در حالی که فیبل در زمینه‌هایی مانند بصری‌سازی وب و گستردگی زبان‌های برنامه‌نویسی موفق‌تر عمل می‌کند. تحلیل‌های اوراکل حاکی از آن است که K3 می‌تواند برای ۷۲ تا ۹۶ درصد وظایف انتخاب شود که آن را به گزینه‌ای ایده‌آل به عنوان مدل پایه تبدیل می‌کند. در نهایت، این پژوهش نشان می‌دهد که دوران اتکا به مدل‌های واحد به پایان رسیده و آینده هوش مصنوعی در گرو استفاده از «مسیریاب‌های هوشمند» و ترکیب مدل‌های تخصصی است تا با کمترین هزینه، بیشترین بهره‌وری حاصل شود. استفاده از یک مسیریاب متناسب با حجم کاری، کلید اصلی حفظ پیشرو بودن در صنعت هوش مصنوعی و بهینه‌سازی عملیات در مقیاس بزرگ است.

K3 یک مدل متن‌باز با کیفیت پیشرو و با کسری از هزینه است. نکته مهم‌تر این است که این مدل به طور قابل پیش‌بینی مکمل فیبل (Fable) است، که امکان دستیابی به بالاترین کیفیت هوش را با مسیریابی وظایف فراهم می‌کند.

خلاصه: ما کیمی K3 (متن‌باز) را در مقابل فیبل 5 (بسته) در حدود 1000 وظیفه عامل‌محور (agentic) اجرا کردیم و به نتایج زیر دست یافتیم:

  1. ما به دقت 93% با مسیریابی بین K3 و فیبل دست یافتیم.
  2. نتایج تا 50 برابر مقرون به صرفه‌تر از فیبل به تنهایی بود در حلقه‌های عامل‌محور طولانی، و به طور مداوم در هر مورد استفاده، هزینه کمتری داشت.

ما بنچمارک‌ها را که هر کدام برای نوع متفاوتی از کار طراحی شده بودند، میانگین‌گیری کردیم و K3 و فیبل 5 را از طریق یک چارچوب یکسان اجرا کردیم. در مجموع حدود 1030 وظیفه، در حلقه‌های عامل‌محور واقعی.

قبل از اینکه به نتایج بپردازیم، یک تعریف سریع. مسیریابی اوراکل (Oracle routing) روشی برای اندازه‌گیری بهترین عملکرد نظری است که با اجرای وظیفه از طریق هر مدل و سپس انتخاب ارزان‌ترین گزینه صحیح (سقف هزینه/عملکرد) انجام می‌شود. در یک مسیریاب عملی، شما نمی‌توانید وظیفه خود را در برابر چندین مدل اجرا کنید. مسیریاب پیش‌بینی می‌کند که کدام مدل بهترین تعادل بین هزینه و کیفیت را دارد، اما در نهایت این یک حدس است.

در این مطالعه، مسیریابی اوراکل نشان داد که K3 برای 72 تا 96 درصد وظایف انتخاب می‌شود. این نشان می‌دهد که یک مسیریاب تقریباً کامل ممکن است قابل دستیابی باشد، با یادگیری تفاوت بین وظایف روزمره و کارهای پیشرفته واقعی. برای اظهار نظر قطعی، به داده‌های مسیریابی بسیار بیشتر و عملکرد واقعی نیاز خواهد بود.

خانوادهچه چیزی را آزمایش می‌کندوظایف
SWEرفع باگ‌های مخزن واقعی (به سبک SWE-bench)460
ترمینالعملیات عامل‌محور طولانی: امنیت، رمزنگاری، مهندسی معکوس، مدیریت سیستم89
الگوریتمیمسائل به سبک LeetCode / AtCoder100
چندزبانهپیاده‌سازی در شش زبان225
حقوقییک بنچمارک عامل حقوقی (وظایف درجه‌بندی شده توسط وکیل)120

K3 یک مدل خوب است.

از دیدگاه کلی، ممکن است به راحتی هر دو مدل را مشاهده کرده و رقابت سر به سر را مساوی دانست. به عنوان مثال، اگر به SWE، بنچمارک اصلی، نگاه کنید، K3 امتیاز 92.4% و فیبل 92.6% را کسب می‌کند. در پنج نوع وظیفه‌ای که ما بنچمارک کردیم، دو مدل تمایل دارند در چند امتیاز از یکدیگر باقی بمانند، با این تفاوت که فیبل در گستردگی زبان برنامه‌نویسی خود (چندزبانه) کمی جلوتر است.

به راحتی می‌توان در اینجا متوقف شد و گفت

اگر به یک بنچمارک واحد نگاهی بیندازید، چیزهای بیشتری از یک عدد دقت کلی برای دیدن وجود دارد. SWE را در نظر بگیرید، جایی که این دو در مجموع کاملاً برابر هستند. اگر SWE را بر اساس حوزه مسئله تقسیم کنید، می‌توانید ببینید که هر مدل در کجا می‌درخشد. K3 در ریاضیات نمادین و ابزارهای توسعه قوی‌تر است؛ فیبل در کارهای بصری‌سازی وب و داده‌ها برنده می‌شود. همین الگو در مجموعه چندزبانه نیز وجود دارد، جایی که گستردگی فیبل جاوا، پایتون و C++ را پوشش می‌دهد، در حالی که K3 در جاوا اسکریپت و راست (Rust) برابر می‌شود.

نمودار بنچمارک‌های فیبل و K3 که نشان می‌دهد حتی تساوی نیز ناهموار است
شکل 2 · حاشیه امتیاز بر اساس دامنه SWE (K3 منهای فیبل). در کل بنچمارک برابر هستند، اما این دو هنوز در هر دامنه تخصصی عمل می‌کنند.

برای کارهای طولانی‌مدت در ترمینال، هدایت یک شل و بررسی سیستم‌ها در ده‌ها مرحله، K3 قابلیت‌های واقعی خود را نشان داد. این مدل مجموعه‌ای از وظایف را که فیبل هرگز نتوانست حل کند، انجام داد: هش 7z، تحلیل رمز FEAL، اسرار فاش شده، یک آسیب‌پذیری زنده، و کارهای ناهمزمان (async) خارج از کنترل.

K3 ترمینال عامل‌محور را در اختیار دارد
شکل 3 · از 89 وظیفه ترمینال، K3 دارای 11 پیروزی انفرادی در مقابل 7 پیروزی فیبل است و خوشه‌های امنیتی و رمزنگاری را به طور کامل در اختیار می‌گیرد.

در حالی که کیفیت در سطح بالا تقریباً برابر است، قیمت نزدیک نیست.

نمودار تفاوت هزینه که نشان می‌دهد مدل‌ها واقعاً در کجا از هم جدا می‌شوند
شکل 4 · مزیت هزینه به ازای هر وظیفه. دو عامل پشت این موضوع هستند: قیمت‌گذاری توکن، و این واقعیت که کدام مدل طولانی‌تر اجرا می‌شود به وظیفه بستگی دارد.

پس این شکاف قیمتی عظیم از کجا می‌آید؟ قیمت‌گذاری توکن، کش‌کردن پرامپت (prompt caching) و تلاش به ازای هر وظیفه. به عنوان مثال، در SWE، K3 بسیار سخت‌تر از فیبل کار می‌کند: تقریباً 55 چرخش و 1.3 میلیون توکن در هر وظیفه در مقابل 21 چرخش و 130 هزار توکن. در وظایف ترمینال طولانی، وضعیت برعکس است: فیبل است که به صورت مارپیچی عمل می‌کند و تا 64 چرخش و 1.5 میلیون توکن را اجرا می‌کند (گاهی اوقات مستقیماً به زمان‌بندی می‌رسد).

نمودار تلاش نیز ناهموار است و هزینه را افزایش می‌دهد
شکل 5 · چرخش‌ها (خطی) و توکن‌ها (لگاریتمی) به ازای هر وظیفه. هیچ یک از مدل‌ها در کل لاغرتر نیستند؛ کار اضافی برای K3 بر عهده SWE و برای فیبل بر عهده وظایف ترمینال است. توجه داشته باشید که محور y برای نمودار توکن‌ها نرخ حل وظیفه است.

کش‌کردن پرامپت بیشتر کار تبدیل این تلاش به مزیت قیمتی K3 را انجام می‌دهد: حتی زمانی که K3 ده برابر توکن‌ها را می‌خواند، با بازدیدهای کش (cache hits) به این معنی است که اجرای SWE همچنان با هزینه کمتری نسبت به فیبل انجام می‌شود. یک معاوضه وجود دارد. وظایف با چرخش‌های اضافی عموماً به معنای زمان ساعت دیواری (wall-clock time) بیشتر در هر اجرا، یعنی اجراهای کندتر هستند. اگر در دو ثانیه به پاسخ نیاز دارید، این مهم است؛ اگر عامل‌ها را در پس‌زمینه در مقیاس اجرا می‌کنید، صورت‌حسابی که کسری از اندازه است، بسیار مهم‌تر است.

اگر هر وظیفه را به کسی که بهترین عملکرد را دارد ارسال کنید، به جایی بین دو مدل نمی‌رسید، بلکه بالاتر از هر دو قرار می‌گیرید.

مسیریابی به ازای هر وظیفه همیشه از هر اجرای تک‌مدلی بهتر عمل می‌کند:

نمودار مسیریابی بهترین مدل و شکست دادن هر دو
شکل 6 · مسیریابی اوراکل به ازای هر وظیفه در مقابل هر مدل به تنهایی. برچسب‌های سبز = امتیازات کسب شده نسبت به بهترین مدل تنها در آن دسته.

مسیریاب اوراکل، K3 را برای 72 تا 96 درصد ترافیک وظایف انتخاب می‌کند. با طراحی یک مسیریاب به این روش، شما به کیفیت کلی بالاتر از هر مدل به تنهایی و با هزینه‌ای نزدیک به استفاده از مدل بهینه‌سازی شده از نظر هزینه دست می‌یابید.

نمودار مدل بهینه‌سازی شده از نظر هزینه بیشتر کار را انجام می‌دهد
شکل 7 · جایی که یک مسیریاب اوراکل هر وظیفه را ارسال می‌کند. یک مدل قوی و بهینه‌سازی شده از نظر هزینه مانند K3 به پیش‌فرض تبدیل می‌شود؛ مدل پریمیوم استثنا است، نه قاعده.

هم کیفیت و هم هزینه را در یک نمودار قرار دهید. K3 به رنگ آبی در سمت چپ (سمت مقرون به صرفه‌تر) فیبل به رنگ قرمز در هر پنج خانواده وظیفه قرار می‌گیرد. دقت بین این دو در نوسان است: فیبل در چندزبانه جلو می‌افتد، K3 در ترمینال و حقوقی، و بقیه تقریباً در یک سطح هستند.

نمودار هزینه کمتر در هر نوع کار
شکل 8 · هزینه (مقیاس لگاریتمی) در مقابل دقت برای هر خانواده. K3 در سمت چپ فیبل قرار دارد، با هزینه کمتر در هر پنج مورد. شکاف‌های عمودی نشان می‌دهند که کدام مدل در کجا قوی‌تر است.

کیمی K3 + فیبل که با هم مسیریابی می‌شوند، بهترین ویژگی‌های آنها را با بهترین قیمت آزاد می‌کنند.

روزهای ارائه‌دهندگان تک‌مدلی و حداکثرسازی توکن به پایان خود نزدیک می‌شود. داده‌های سطح وظیفه نشان می‌دهد که این مدل‌ها متخصصانی با قیمت‌های بسیار متفاوت هستند. بهترین هوش مصنوعی دیگر از یک آزمایشگاه واحد بیرون نمی‌آید، بلکه ترکیبی از مدل‌هاست.

این در عمل به چه معناست:

  1. متن‌باز به عنوان پیش‌فرض. یک مدل متن‌باز با 50 برابر هزینه کمتر مانند K3 باید مورد پایه شما باشد، زیرا اوراکل (oracle) به هر حال بیشتر ترافیک را به آن ارسال می‌کند.
  2. مسیریاب، سنگر شماست. یک مسیریاب باید متناسب با حجم کاری شما باشد و یادگیری مداوم تقسیم وظیفه/مدل بهترین شانس شما برای پیشرو ماندن خواهد بود.
اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: fireworks.ai