:
وقتی آنتروپیک کلود اپوس ۵.۵ را این هفته منتشر کرد، این شرکت ادعا کرد مدل جدید ۴۰٪ کمتر از اپوس ۵ هزینه دارد و خروجی را ۳۰٪ سریعتر تولید میکند. بازاریابی آنتروپیک سه ادعا مطرح میکند: اپوس ۵.۵ در سطح کلود فابل ۵.۱ عمل میکند (پس باید از اپوس ۵ بهتر باشد)، در بارهای کاری معمول ۴۰٪ کمتر از اپوس ۵ هزینه دارد، و خروجی را بیش از ۳۰٪ سریعتر تولید میکند.
:
آنتروپیک همچنین قیمتی را که توسعهدهندگان برای استفاده از مدل از طریق API خود میپردازند کاهش داد. اپوس ۵.۵ برای هر میلیون توکن (تکههای متنی به طول تقریباً سهچهارم یک کلمه) ارسالی به مدل ۴ دلار و برای هر میلیون توکن نوشتهشده ۲۰ دلار هزینه دارد که از ۵ و ۲۵ دلار برای اپوس ۵ کاهش یافته است. همین کاهش قیمت بهتنهایی ۲۰٪ صرفهجویی را توضیح میدهد. باقی ۴۰٪ ادعاشده باید از استفاده مدل از توکنهای کمتر بیاید.
:
میخواستم ببینم این موضوع برای کاربر معمولی کلود چه معنایی دارد، بنابراین این بار شبیهسازیهای معمول گردشکار توسعهدهنده را نادیده گرفتم. اخیراً مدلهایی که آزمایش میکنم از عهده وظایف روزمره بهخوبی برمیآیند. وظایف استدلالی جایی است که دیدهام به مشکل میخورند، پس اپوس ۵ را فقط در وظایف استدلالی در برابر اپوس ۵.۵ آزمایش کردم.
:
اگر میخواهید این آزمونها را روی سیستم خودتان تکرار کنید، پرامپتها را در انتهای این مطلب مییابید.
آزمونها
هر دو مدل را با پرامپتهای یکسان از طریق API آنتروپیک فراخوانی کردم. هر دو با تفکر تطبیقی در سطح تلاش پیشفرض اجرا شدند، چون اپوس ۵.۵ اجازه نمیدهد تفکر را خاموش کنید. هر مسئله یک بار برای هر مدل اجرا شد. قصد داشتم هر مسئلهای را که مدلها نتایج متفاوتی در آن میدادند دوباره اجرا کنم، اما هرگز چنین نشد.
آزمونهایی که اجرا کردم:
- جدول منطقی (سختی متوسط) – هفت مهندس هر کدام یک روز کشیک، یک زبان، یک سرویس و یک شهر دارند و ۲۲ سرنخ یک پاسخ را مشخص میکند. شش سرنخ شرطی یا از نوع «دقیقاً یکی از اینها درست است» هستند و حذف هر سرنخ واحد، معما را میشکند.
- ترتیبهای محدود (سختی دشوار) – ۱۰ کار استقرار را طوری بازچینی کنید که هیچ کاری در جای اصلی خود نماند و هیچ دو کار با شماره متوالی کنار هم قرار نگیرند. مدل باید تعداد را برای ۶، ۸ و ۱۰ کار ارائه میداد.
- بازی سنگی با حافظه (سختی دشوارتر) – بازیکنان ۲، ۵، ۷ یا ۱۱ سنگ برمیدارند، اما نمیتوانند حرکت آخر حریف یا حرکت آخر خود را تکرار کنند. مدل باید تعیین میکرد چه کسی از ۲۰۰ سنگ برنده میشود، تعداد اندازههای شروع باخت تا ۵۰۰ را میشمرد و کوچکترین اندازه باخت بالای ۳۴۰ را نام میبرد.
:
توکنهای ورودی، توکنهای خروجی، هزینه با قیمت فهرست و زمان هر فراخوانی را ثبت کردم. توکنهای تفکر بهعنوان خروجی محاسبه میشوند، پس آنها را هم لحاظ کردم.
جدول منطقی
هر دو مدل هر ۲۸ خانه را درست پر کردند. اپوس ۵.۵ ۶۵ ثانیه و ۷٬۵۷۳ توکن خروجی صرف کرد، با هزینه ۰٫۱۶ دلار. اپوس ۵ ۱۰۸ ثانیه و ۱۰٬۶۲۱ توکن خروجی صرف کرد، با هزینه ۰٫۲۷ دلار.
در این آزمون، اپوس ۵.۵ ۴۳٪ ارزانتر بود و همان پاسخ درست را ارائه داد. اپوس ۵.۵ کمی مفصلتر بود و اشاره کرد که یکتایی راهحل را کاملاً اثبات نکرده است.
ترتیبهای محدود
هیچکدام از مدلها پاسخی تولید نکردند و همین آن را در عمل دشوارترین مسئله ساخت. تعدادهای درست ۲۷، ۱٬۶۹۵ و ۱۵۹٬۰۱۹ هستند. رسیدن به پاسخ سوم تنها با استدلال بسیار دشوار است. یک برنامه رایانهای که همه ترتیبهای ممکن را بررسی کند میتواند آن را بیابد، اما هیچکدام از مدلها در این آزمون نمیتوانستند کد اجرا کنند.
با محدودیت خروجی ۴۸٬۰۰۰ توکن، هر دو مدل تمام بودجه را صرف تفکر کردند و هرگز پاسخ ندادند. اپوس ۵.۵ ۴۸۹ ثانیه و ۰٫۹۶ دلار صرف کرد. اپوس ۵ ۵۵۳ ثانیه و ۱٫۲۰ دلار صرف کرد.
محدودیت را به ۱۲۸٬۰۰۰ توکن افزایش دادم و دوباره اجرا کردم. اپوس ۵ از تمام توکنها استفاده کرد، بیش از ۲۵ دقیقه طول کشید و بدون پاسخ متوقف شد. این ۳٫۲۰ دلار هزینه داشت. اپوس ۵.۵ ۱۹ دقیقه اجرا شد و ۱۱۲٬۷۳۳ توکن استفاده کرد، اما API پاسخ را با دلیل توقف «رد» و بدون متن پایان داد. پرامپت از مدل میخواهد ترتیبهای کار را بشمارد و هیچ محتوای حساسی ندارد. این یعنی رد کردن به احتمال زیاد اشتباهی از سوی فیلتر ایمنی آنتروپیک بوده که یک درخواست بیضرر را علامتگذاری کرده است.
اپوس ۵.۵ ارزانتر بود، اما اگر نتیجهای نگیرید این چه اهمیتی دارد؟
بازی سنگی
و دوباره به همان پاسخهای یکسان برگشتیم. هر دو مدل به هر سه بخش درست پاسخ دادند. بازیکن اول از ۲۰۰ سنگ میبازد؛ اندازههای شروع از ۱۲۰ تا ۵۰۰ باخت هستند و کوچکترین باخت بالای ۳۴۰ عدد ۳۴۴ است.
تفاوت در این آزمون به میزان تفکری که هر کدام برای رسیدن به پاسخ نیاز داشتند برمیگشت. اپوس ۵.۵ در ۲۱۵ ثانیه با ۲۸٬۷۴۰ توکن خروجی تمام شد و ۰٫۵۸ دلار هزینه داشت. اپوس ۵ ۶۲۴ ثانیه طول کشید و ۷۴٬۹۸۱ توکن خروجی تولید کرد و ۱٫۸۸ دلار هزینه داشت. اپوس ۵.۵ برای همان پاسخ ۶۲٪ توکن کمتر و ۶۹٪ هزینه کمتر داشت.
نتایج
| آزمون | اپوس ۵.۵ | اپوس ۵ |
| جدول منطقی | ۲۸/۲۸، ۱:۰۵، ۹۰۸ ورودی / ۷٬۵۷۳ خروجی، ۰٫۱۶ دلار | ۲۸/۲۸، ۱:۴۸، ۹۰۶ ورودی / ۱۰٬۶۲۱ خروجی، ۰٫۲۷ دلار |
| مسئله ترتیبدهی (محدودیت ۴۸ هزار) | بدون پاسخ، ۸:۰۹، ۲۳۵ ورودی / ۴۸٬۰۰۰ خروجی، ۰٫۹۶ دلار | بدون پاسخ، ۹:۱۳، ۲۳۳ ورودی / ۴۸٬۰۰۰ خروجی، ۱٫۲۰ دلار |
| مسئله ترتیبدهی (محدودیت ۱۲۸ هزار) | بدون پاسخ (رد)، ۱۸:۵۶، ۲۳۵ ورودی / ۱۱۲٬۷۳۳ خروجی، ۲٫۲۶ دلار | بدون پاسخ، ۲۵:۲۴، ۲۳۳ ورودی / ۱۲۸٬۰۰۰ خروجی، ۳٫۲۰ دلار |
| بازی سنگی | ۳/۳، ۳:۳۵، ۳۲۳ ورودی / ۲۸٬۷۴۰ خروجی، ۰٫۵۸ دلار | ۳/۳، ۱۰:۲۴، ۳۲۱ ورودی / ۷۴٬۹۸۱ خروجی، ۱٫۸۸ دلار |
| مجموع توکنها | ۱٬۷۰۱ ورودی / ۱۹۷٬۰۴۶ خروجی | ۱٬۶۹۳ ورودی / ۲۶۱٬۶۰۲ خروجی |
| مجموع زمان | ۳۱ دقیقه و ۴۵ ثانیه | ۴۶ دقیقه و ۴۹ ثانیه |
| هزینه | ۳٫۹۵ دلار (۴ دلار ورودی / ۲۰ دلار خروجی به ازای هر میلیون توکن) | ۶٫۵۵ دلار (۵ دلار ورودی / ۲۵ دلار خروجی به ازای هر میلیون توکن) |
در مجموع تمام فراخوانیها، اپوس ۵.۵ ثانیهای ۱۰۳٫۴ توکن نوشت و اپوس ۵ ثانیهای ۹۳٫۱ توکن، پس اپوس ۵.۵ حدود ۱۱٪ سریعتر بود. بزرگترین برتری سرعت آن در یک مسئله واحد ۱۹٪ بود که همچنان کمتر از ادعای ۳۰ درصدی آنتروپیک است. بزرگترین صرفهجویی هزینهاش در بازی سنگی رخ داد که ۰٫۵۸ دلار در برابر ۱٫۸۸ دلار اپوس ۵، یعنی ۶۹٪ کمتر، هزینه داشت. مجموع هزینه آزمون ۱۰٫۵۰ دلار بود.
نظر من چیست
بنچمارکهای آنتروپیک نشان میدهند اپوس ۵.۵ در کدنویسی، کار دانشی و استدلال از اپوس ۵ جلوتر است. من آن بنچمارکها را دوباره اجرا نکردم. به هر دو مدل همان سه مسئله استدلالی را دادم و عملکردشان برابر بود. هر دو جدول منطقی و بازی سنگی را حل کردند و هر دو در مسئله ترتیبدهی شکست خوردند.
صرفهجویی واقعی است. اپوس ۵.۵ در هر مسئله کمتر هزینه داشت و زودتر تمام شد، از جمله ۴۳٪ کمتر در جدول منطقی و ۶۹٪ کمتر در بازی سنگی. بیشتر این صرفهجویی از استفاده از توکنهای خروجی کمتر میآمد. کاهش قیمت ۲۰٪ را توضیح میدهد. سرعت نوشتنش ۱۱٪ بیشتر بود که کمتر از ۳۰٪ ادعایی آنتروپیک است.
اگر امروز از اپوس ۵ استفاده میکنید، به اپوس ۵.۵ مهاجرت کنید. در استدلال دشوار با هزینه کمتر و انتظار کمتر همان نتایج را میگیرید. اما محدودیت سخت خروجی تعیین کنید و هزینهتان را در مسائل دشوار زیر نظر بگیرید. هر دو مدل میتوانند نزدیک به ۲۰ دقیقه یا بیشتر فکر کنند و هیچ چیزی برنگردانند که اگر برای هر توکن پول بدهید مشکلی است. برای مسائل شمارشی مانند آزمون ترتیبدهی، به مدل یک ابزار اجرای کد بدهید، نه اینکه امیدوار باشید با استدلال از پس آن بربیاید.
پرامپتها
جدول منطقی
هفت مهندس (آنا، بن، سای، دی، ایلای، فی، گاس) در یک چرخه کشیک سهیم هستند. هر کدام دقیقاً یک روز از یک هفته، از دوشنبه تا یکشنبه (دوشنبه زودترین روز و یکشنبه دیرترین)، کشیک هستند و هیچ دو نفری یک روز مشترک ندارند. هر کدام به زبان متفاوتی مینویسند (Go، Rust، Python، Java، Kotlin، TypeScript، C++)، مالک سرویس متفاوتی هستند (auth، billing، search، queue، cache، gateway، metrics) و در شهر متفاوتی مستقر هستند (برلین، توکیو، دنور، لاگوس، سیدنی، تورنتو، بمبئی).
سرنخها:
توسعهدهنده جاوا گاس است.
توسعهدهنده تایپاسکریپت دقیقاً دو روز بعد از مالک صف کشیک است.
دقیقاً یکی از اینها درست است: مهندس مستقر در برلین مالک صورتحساب است، یا توسعهدهنده C++ دوشنبه کشیک است.
دقیقاً یکی از اینها درست است: مهندس مستقر در توکیو مالک کش است، یا مهندس مستقر در توکیو به زبان Rust مینویسد.
اگر فی یکشنبه کشیک باشد، آنگاه مهندس مستقر در دنور به زبان Kotlin نمینویسد.
دقیقاً یکی از اینها درست است: توسعهدهنده Kotlin مالک احراز هویت است، یا توسعهدهنده C++ سای است.
مهندس مستقر در توکیو در هفته زودتر از توسعهدهنده C++ کشیک است.
مهندس مستقر در دنور به زبان Python نمینویسد.
دقیقاً یکی از اینها درست است: توسعهدهنده Go بن است، یا مالک دروازه در برلین مستقر است.
آنا در بمبئی مستقر است.
توسعهدهنده تایپاسکریپت در هفته زودتر از فی کشیک است.
مهندس مستقر در سیدنی در هفته زودتر از مالک صورتحساب کشیک است.
مالک دروازه در هفته زودتر از توسعهدهنده Kotlin کشیک است.
مهندس کشیک یکشنبه در برلین مستقر نیست.
فی و مهندس مستقر در لاگوس در روزهای متوالی کشیک هستند.
ایلای دقیقاً سه روز بعد از مالک احراز هویت کشیک است.
مهندس مستقر در لاگوس به زبان Java مینویسد.
دقیقاً یکی از اینها درست است: مالک جستجو ایلای است، یا مالک کش دی است.
مالک دروازه و توسعهدهنده Go در روزهای متوالی کشیک هستند.
مهندس مستقر در لاگوس دقیقاً چهار روز بعد از مالک احراز هویت کشیک است.
مهندس مستقر در لاگوس مالک معیارها است.
مهندس مستقر در بمبئی در هفته زودتر از توسعهدهنده Python کشیک است.
تخصیص کامل را تعیین کنید. در پایان پاسخ خود، دقیقاً هفت خط، یکی برای هر مهندس به ترتیب آنا، بن، سای، دی، ایلای، فی، گاس، با این قالب ارائه دهید:
ANSWER: Name | Day | Language | Service | City
مسئله ترتیبدهی
یک سیستم ساخت n کار استقرار شمارهگذاریشده از ۱ تا n دارد. در ابتدا، کار k در جایگاه k اجرا میشود. شما همه n کار را در جایگاههای ۱ تا n بازچینی میکنید (هر جایگاه یک کار میگیرد) با رعایت دو قاعده:
هیچ کاری در جایگاه اصلی خود اجرا نمیشود (کار k در جایگاه k نیست).
کارهای با شماره متوالی هرگز در جایگاههای مجاور اجرا نمیشوند (برای مثال، کارهای ۴ و ۵ نمیتوانند به هر ترتیبی در جایگاههای i و i+1 باشند).
چند ترتیب معتبر برای (الف) n = 6، (ب) n = 8، (ج) n = 10 وجود دارد؟
در پایان پاسخ خود، دقیقاً سه خط با این قالب ارائه دهید:
ANSWER a: <number>
ANSWER b: <number>
ANSWER c: <number>
بازی سنگی
دو بازیکن با تودهای از سنگها بازی میکنند. آنها بهنوبت بازی میکنند. در هر نوبت، بازیکن دقیقاً ۲، ۵، ۷ یا ۱۱ سنگ برمیدارد، با رعایت دو قاعده:
نمیتوانید همان تعدادی را بردارید که حریف در آخرین نوبت خود برداشت.
نمیتوانید همان تعدادی را بردارید که خودتان در آخرین نوبت خود برداشتید.
(در اولین نوبت بازی، هیچکدام از قواعد اعمال نمیشود. در اولین نوبت بازیکن دوم، فقط قاعده اول اعمال میشود.) نمیتوانید بیشتر از سنگهای موجود در توده بردارید. بازیکنی که در نوبت خود حرکت قانونی ندارد میبازد. هر دو بازیکن بینقص بازی میکنند.
(الف) با شروع از ۲۰۰ سنگ، آیا بازیکن اول برنده میشود؟
(ب) بازیکن اول برای چند اندازه شروع از ۱ تا ۵۰۰ (شامل) میبازد؟
(ج) کوچکترین اندازه شروع بزرگتر از ۳۴۰ که بازیکن اول در آن میبازد چیست؟
در پایان پاسخ خود، دقیقاً سه خط با این قالب ارائه دهید:
ANSWER a: <yes or no>
ANSWER b: <number>
ANSWER c: <number>