,
کلود سانت ۵.۵ را معرفی میکنیم؛ دومین مدل از خانواده کلود ۵.۵. این مدل ارتقایی آشکار نسبت به کلود سانت ۵ است، بیش از ۳۰ درصد سریعتر اجرا میشود و برای بیشتر کارها تا ۳۰ درصد هزینه کمتری دارد.
سانت ۵.۵ مکملی سریعتر و کمهزینهتر برای کلود اوپوس ۵.۵ است. جایی که اوپوس ۵.۵ برای کارهای پیچیدهای ساخته شده که به قضاوت دقیق نیاز دارند، سانت ۵.۵ در وظایف روزمره با دامنه مشخص، رفع اشکال و تولید اسناد، اسلایدها و صفحات گستردهی صیقلخورده قویترین است. همچنین چشمی تیزبین برای طراحی دارد. کلود هایکو ۵.۵ که برای کاربردهای پرحجم و حساس به هزینه ساخته شده است، در هفتههای آینده به خانواده کلود ۵.۵ میپیوندد.
,
سانت ۵.۵ نسبت به سانت ۵ در موارد زیر بهبود یافته است:
عملکرد. سانت ۵.۵ در ترمینال-بنچ ۴.۰، یک ارزیابی کدنویسی عاملی، امتیاز ۷۰.۶ درصد کسب میکند، در حالی که سانت ۵ امتیاز ۱۰.۳ درصد داشت. این مدل در GDPval-AA، آزمونی از کارهای دنیای واقعی در مشاغل گوناگون، دو امتیاز پایینتر از اوپوس ۵.۵ قرار میگیرد. همچنین در کارهای بلندمدت و درک تصویر قوی است؛ نخستین مدل سانت است که تنها با استفاده از تصاویر صفحه، بازی پوکمون رد را شکست میدهد.
همکاری. مانند اوپوس ۵.۵، سانت ۵.۵ شفافتر از نسل پیشین مدلهای ما مینویسد؛ آزمایشکنندگان اولیه آن را شریکی بهتر برای همکاری نسبت به سانت ۵ توصیف کردند. سرعت آن نیز آن را برای تکرار سریع در وظایف کمپیچیده مناسب میکند.
هزینه. قیمت سانت ۵.۵ مانند سانت ۵ است: ۲ دلار برای هر میلیون توکن ورودی، ۱۰ دلار برای هر میلیون توکن خروجی و ۰.۲۰ دلار برای هر میلیون توکن خواندهشده از حافظه پنهان؛ اما معمولاً برای انجام همان کار به توکنهای بسیار کمتری نیاز دارد. در آزمونهای ما، هزینه هر وظیفه آن تا ۳۰ درصد کمتر از نسل پیشین است.
سرعت. سانت ۵.۵ خروجیها را بیش از ۳۰ درصد سریعتر از سانت ۵ تولید میکند و سریعترین مدل سانت ما تا امروز است.
همراستایی و ایمنی. در ممیزی رفتاری خودکار ما، سانت ۵.۵ در بیشتر سنجههای همراستایی نسبت به سانت ۵ بهبود یافته یا با آن برابر است. چون توانمندیهای امنیت سایبری آن با اوپوس ۵ قابل مقایسه است، نخستین مدل سانت است که با تدابیر حفاظتی و جایگزینهای سایبری مشابه آنچه برای توانمندترین مدلهایمان توسعه دادهایم عرضه میشود. تدابیر حفاظتی زیستی آن همانند سانت ۵ است. هر دو تدبیر حفاظتی مجموعهای محدود از درخواستهای پرخطر را هدف میگیرند؛ توسعه نرمافزارهای معمول و بیشتر کارهای علوم زیستی تحت تأثیر قرار نمیگیرند.
عملکرد
سانت ۵.۵ در حوزههای گوناگون نسبت به سانت ۵ بهبود یافته است—در برخی موارد بهشکل چشمگیر. در چند ارزیابی، سانت ۵.۵ با تلاش حداکثری حتی عملکردی قابل مقایسه با اوپوس ۵.۵ دارد. با این حال، امتیازهای محک تنها یک جنبه از توانمندیهای مدل را نشان میدهند؛ در آزمونهای خود ما و آزمایشکنندگان بیرونی، اوپوس ۵.۵ همچنان در کارهای پیچیده و باز که به قضاوت مستمر نیاز دارند، آشکارا قویتر است.
,
نمودارهای زیر امتیاز هر مدل را در برابر هزینه هر وظیفه آن در هر سطح تلاش نشان میدهند. با افزایش تلاش، مدلها معمولاً بیشتر کار میکنند که به هزینه بیشتر برای هر وظیفه میانجامد، اما عموماً امتیاز بالاتری نیز به همراه دارد. هرچه یک نقطه به گوشه بالا-چپ نمودار نزدیکتر باشد، توانمندی بیشتری به ازای هر دلار ارائه میدهد.
,
در چند محک، سانت ۵.۵ با تلاش کم یا متوسط بهترین امتیاز سانت ۵ را با حدود یکدهم هزینه هر وظیفه شکست میدهد. بهترین مکمل اوپوس ۵.۵ زمانی است که با تنظیمات تلاش پایینتر اجرا شود، جایی که هزینه هر وظیفه کمتری دارد. در تنظیمات بالاتر، میتواند با هزینهای مشابه عملکردی قابل مقایسه داشته باشد.
ترمینال-بنچ ۴.۰ میسنجد که یک مدل چقدر میتواند وظایف حرفهای پیچیده و چندمرحلهای را در یک رابط خط فرمان کامل کند. در تلاش متوسط، که پیشفرض در اپلیکیشنهای کلود است، سانت ۵.۵ بهترین امتیاز سانت ۵ را با کمتر از یکدهم هزینه هر وظیفه پشت سر میگذارد.
ترمینال-بنچ و اوپنایآی عملکرد GPT-6 Sol را بهصورت عمومی گزارش نکردند، بنابراین ما GPT-5.6 Sol را در اینجا گزارش میکنیم.
کدنویسی
جهش عملکرد سانت ۵.۵ بهویژه در کدنویسی محسوس است. در تلاش بالا روی فرانتیرکد، امتیاز آن ۱۰ امتیاز بالاتر از سانت ۵ در همان تنظیم است، با حدود یکپانزدهم هزینه هر وظیفه. در کرسوربنچ، که مدلها را روی وظایف برگرفته از جلسات واقعی کدنویسی کرسور میآزماید، بهترین امتیاز آن تا حدود دو امتیاز به اوپوس ۵.۵ میرسد.
آزمایشکنندگان اولیه از سرعت درک سانت ۵.۵ از یک پایگاه کد قدردانی کردند. همچنین کارآمدی آن توجهشان را جلب کرد: در اجراهای رودررو، فراخوانیهای ابزار را بیش از سانت ۵ دستهبندی میکرد که به گامهای کمتر و هزینههای پایینتر میانجامید.
,
«در آزمونهای اولیه اپیک، کلود سانت ۵.۵ همان استاندارد کیفی را که از یک مدل رده بالاتر انتظار دارید برآورده کرد و در ممیزی طراحی سیستم و بازبینی جریان داده مقاوم بود. مدل جدید دهها هزار خط کد برای معماری سیستم گیمپلی را مدیریت کرد، پاسخها را سریع نگه داشت، وظایف چندساعته را انجام داد و با دستورهای کمتر تجویزی تحویل داد.»
اپیک گیمز — دانیل فوگل، مدیر ارشد عملیات
کار دانشی
سانت ۵.۵ در چند حوزه کار دانشی پیشرفت نشان میدهد. در GDPval-AA، که مدلها را روی وظایف دنیای واقعی در ۴۴ شغل و ۹ صنعت اصلی میآزماید، سانت ۵.۵ تقریباً همسطح اوپوس ۵.۵ و حدود ۴۰۰ امتیاز بالاتر از سانت ۵ امتیاز میگیرد. در استفاده از رایانه و تشخیص نمودار نزدیک به اوپوس ۵.۵ است و در کارهای دانشی بلندمدت آشکارا از سانت ۵ و GPT-6 Sol بهتر عمل میکند.
آزمایشکنندگان اولیه به بهبودهای کمتر قابلاندازهگیری اشاره کردند. آنها آن را شریکی گفتوگویی طبیعیتر یافتند و به ذوق آن در طراحی اشاره کردند و یادآور شدند که به رابطهای کاربری صیقل میبخشد و میتواند قالبهای اسلاید را دنبال کند تا ارائههایی بسازد که ویرایش کمینه نیاز دارند. در یک آزمون داخلی، مواد مالی سهماهه و متن تماسهای یک شرکت بورسی را همراه با یک قالب اسلاید به آن دادیم و خواستیم یک مرور عملیاتی ۱۰ اسلایدی بسازد. دو کارشناس پیشنویس اول آن را آماده ارسال بیکموکاست دانستند.
,
«بدون تغییر هیچیک از دستورهای ما، کلود سانت ۵.۵ در تقریباً همه ارزیابیهای آفلاین اسلکبات ما بهتر از سانت ۵ عمل کرد، با گامهای کمتر و حدود ۱۴ درصد توکن خروجی کمتر. وقتی کسی به اسلکبات وظیفهای میسپارد، کیفیت و سرعت مهمترین چیز است و سانت ۵.۵ به اسلکبات امکان میدهد نتایج بهتری را سریعتر برای کاربران فراهم کند.»
اسلک — کرتیس آلن، مهندس ارشد
هزینه و سرعت
سانت ۵.۵ برای هر وظیفه به توکنهای کمتری از سانت ۵ نیاز دارد، بنابراین اجرای آن کمهزینهتر است. همچنین خروجی را بیش از ۳۰ درصد سریعتر تولید میکند و کارآمدی آن بیدرنگ محسوس است:
,
تنظیم سطح تلاش به شما امکان میدهد هزینه و سرعت را در برابر کیفیت کلی متعادل کنید. در کلود کد و اپلیکیشنهای ما، تلاش پیشفرض روی متوسط تنظیم شده است، در حالی که پلتفرم کلود پیشفرض را بالا قرار میدهد. در تنظیمات پایینتر، کلود سریعتر پاسخ میدهد و توکن کمتری مصرف میکند که برای کارهای روزمره مناسب است. در تنظیمات بالاتر، کلود طولانیتر استدلال میکند و کار خود را دقیقتر بررسی میکند.
ایمنی
همراستایی
سانت ۵.۵ مرز توانمندیهای مدلهای ما را جابهجا نمیکند، بنابراین ارزیابی همراستایی ما بر مجموعهای هدفمند از خطرات متمرکز شد که به مدلهای هر سطح توانمندی مربوط میشوند، از جمله اقدام علیه منافع کاربران، گمراهکردن کاربران و همکاری در سوءاستفاده پرخطر.
در ممیزی رفتاری خودکار ما، که کلود را در حدود ۱۸۵۰ سناریو میآزماید، سانت ۵.۵ در بیشتر سنجههای همراستایی، مقاومت در برابر سوءاستفاده و صداقت نسبت به سانت ۵ بهبود یافته یا با آن برابر است. در ارزیابیهای جدیدتر مهار ما، سانت ۵.۵ در اینکه بهندرت تلاش میکند از محیط محدود خود بگریزد به اوپوس ۵.۵، بهترین مدل آزمونشده ما، نزدیک میشود و از همه مدلهای ما کمترین احتمال را دارد که محدودیتهای ظرف خود را بکاود. در کل ممیزی، اوپوس ۵.۵ همچنان بهطور کلی کمی بهتر عمل میکند، اما هیچ شاهدی نیافتیم که سانت ۵.۵ اهدافی مغایر با قصد کاربر را دنبال کند.
همانطور که در ارزیابی همراستایی اخیر خود توضیح دادیم، هیچ مجموعهای از ارزیابیها بهطور قابلاعتماد همه شکستها را شناسایی نمیکند و ممکن است سانت ۵.۵ گرایشهایی داشته باشد که ما نیافتهایم؛ به همین دلیل کار همراستایی خود را با تدابیر حفاظتی توصیفشده در زیر همراه میکنیم.
,
تدابیر حفاظتی
امنیت سایبری. توانمندیهای سایبری سانت ۵.۵ بهبود بزرگی نسبت به سانت ۵ است، بنابراین آن را با تدابیر حفاظتی مشابه آنچه روی اوپوس ۵.۵ اعمال شده مستقر میکنیم. کاربران همچنان میتوانند بهعنوان بخشی از توسعه نرمافزارهای معمول، اشکالات کد خود را بیابند و رفع کنند، اما وظایف پرخطرتر امنیت سایبری بهطور محسوس به سانت ۵ بازمیگردند. بهزودی مدافعان سایبری میتوانند برای دسترسی لایهای به توانمندیهای پیشرفتهتر روی مدلهای سانت ۵.۵، اوپوس ۵.۵ و کلود میتوس، به برنامه گسترده تأیید سایبری ما درخواست دهند.
زیستشناسی. سانت ۵.۵ از همان مجموعه تدابیر حفاظتی زیستی سانت ۵ استفاده میکند. این تدابیر درخواستهای زیانبار را هدف میگیرند؛ بیشتر کارهای پژوهشی، آموزشی و بالینی تحت تأثیر قرار نمیگیرند، هرچند ممکن است برخی درخواستهای میکروبیولوژی و ویروسشناسی بهاشتباه علامتگذاری شوند. سازمانها میتوانند برای دسترسی به تدابیر حفاظتی طراحیشده برای تمام گستره کارهای مرتبط با زیستشناسی، به برنامه تأیید علوم زیستی ما درخواست دهند.
تقطیر. حملات تقطیر، که در آن مهاجمان با هزاران حساب جعلی توانمندیهای یک مدل را در مقیاس صنعتی استخراج میکنند، به بدخواهان امکان میدهد مدلهای بسیار توانمندی بدون تدابیر حفاظتی که در کلود تعبیه کردهایم بسازند. چون سانت ۵.۵ بسیار توانمندتر از نسل پیشین خود است، نخستین مدل سانت است که با طبقهبندهای ایمنی برای جلوگیری از استخراج استدلال عرضه میشود. سانت ۵.۵ همچنین تفکر حفظشده را گسترش میدهد تا تفکر کلود نتواند از حسابی که آن را ساخته جدا شود. بیشتر توسعهدهندگان تغییری متوجه نخواهند شد. اگر گفتوگوها را بین حسابها منتقل میکنید، از جمله تغییر حساب در میانه جلسه در کلود کد، مقاله مستندات ما این تغییر را توضیح میدهد.
شروع کار
مانند اوپوس ۵.۵ و سانت ۵، کلود سانت ۵.۵ با نگهداری صفر داده در دسترس است.
کلود سانت ۵.۵ هماکنون در همه پلتفرمها، از جمله آمازون وب سرویسز، گوگل کلود و مایکروسافت آژور در دسترس است. توسعهدهندگان میتوانند کار خود را در پلتفرم کلود با claude-sonnet-5-5 آغاز کنند. اگر سانت را با تفکر خاموش اجرا میکنید، باید پیش از رفتن به سانت ۵.۵ به تنظیم جدید between_tools سوئیچ کنید که تفکر پیشرو را خاموش نگه میدارد. برای جزئیات، راهنمای مهاجرت ما را ببینید.
پانویسها
۱ نتایج ترمینال-بنچ ۴.۰ برای کلود اوپوس ۵.۵ با تلاش Xhigh گزارش شده است که بالاترین امتیاز مدل را نشان میدهد.
۲ سانت ۵.۵ در تلاش حداکثری امتیاز کمتری از Xhigh دارد. فرانتیرکد میسنجد که آیا یک تغییر کد میتواند بدون ویرایش انسانی ادغام شود. این محک تغییرات خارج از دامنه را جریمه میکند، حتی اگر باکیفیت یا مفید باشند. در تلاش حداکثری، سانت ۵.۵ بیشتر مهارت بازبینی کد کلود کد را اجرا میکرد که بازبینی را میان بسیاری از زیرعاملها تقسیم میکند و در دو موردی که کاگنیشن بررسی کرد، این به وقفه زمانی یا ویرایشهای اضافی فراتر از دامنه وظیفه و در نتیجه امتیاز پایینتر انجامید.
۳ آرتیفیشال آنالیزیس GDPval-AA و AA-Briefcase را روی استقرار پیشازعرضه سانت ۵.۵ در پلتفرم کلود اجرا کرد که ما در آن اشکالی یافتیم که میتوانست پاسخها به درخواستهای دارای خروجی ساختاریافته را تضعیف کند. انتظار داریم تأثیر آن بر امتیازهای سانت ۵.۵، اگر وجود داشته باشد، اندک باشد و عملکرد آن را کمتر از واقع نشان دهد. آن اشکال از آن زمان رفع شده است.
۴ اوپنایآی اخیراً اشکالی را رفع کرد که درک تصویر در GPT-6 Sol را تضعیف میکرد. امتیازهای رسمی AA-Briefcase v1.1 و GDPval-AA v2.1 از آرتیفیشال آنالیزیس و امتیازهای Chartography از Surge AI ممکن است هنوز برای بازتاب آخرین نسخه مدل بهروزرسانی نشده باشند. آرتیفیشال آنالیزیس انتظار تأثیرات عمده بر AA-Briefcase v1.1 و GDPval-AA v2.1 را ندارد. آزمون داخلی Chartography نشان میدهد امتیاز آن تحت تأثیر قرار نگرفته است.