اشتراک
فناوری هوش مصنوعی

معرفی GPT-6 Sol و Luna

راه‌های بیشتر برای آوردن هوش پیشرفته به کار روزمره شما

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

شرکت OpenAI با معرفی مدل‌های جدید GPT-6 Sol و GPT-6 Luna، خانواده هوش مصنوعی GPT-6 را گسترش داده است. این مدل‌ها با هدف ارائه هوشمندی پیشرفته در کنار بهره‌وری هزینه‌ای بالا طراحی شده‌اند تا جایگزین‌های سریع‌تر و مقرون‌به‌صرفه‌تری برای پروژه‌های متنوع باشند. یکی از تغییرات کلیدی در این نسخه، کاهش ۵۰ درصدی قیمت API نسبت به مدل‌های قبلی است که در کنار بهبودهای فنی در کشینگ و استنتاج، استفاده از هوش مصنوعی را در مقیاس‌های بزرگ اقتصادی‌تر می‌کند. مدل‌های جدید در زمینه‌های مختلف از جمله انجام کارهای حرفه‌ای، صحت‌سنجی اطلاعات و کدنویسی، عملکردی خیره‌کننده و رقابتی ارائه می‌دهند؛ به‌طوری که در برخی ارزیابی‌ها نظیر AutomationBench و DeepSWE، مدل Sol با هزینه‌ای به‌مراتب کمتر، نتایجی هم‌تراز یا حتی بهتر از مدل‌های قدرتمند رقبا کسب کرده است. علاوه بر ارتقای عملکرد، سبک ارتباطی این مدل‌ها نیز بهبود یافته تا پاسخ‌های دقیق‌تر، شفاف‌تر و کوتاه‌تری ارائه دهند. همچنین با بهبود سیستم کشینگ پرامپت، نرخ اصابت کش افزایش یافته که منجر به کاهش هزینه‌های پردازش و افزایش سرعت پاسخ‌دهی برای توسعه‌دهندگان شده است. GPT-6 Sol و Luna بر پایه استانداردهای همسوسازی مدل پیشرو GPT-6 Astra بنا شده‌اند و نرخ خطاهای گمراه‌کننده در آن‌ها کاهش یافته است. این مدل‌ها هم‌اکنون برای کاربران پلتفرم‌های مختلف OpenAI در دسترس قرار گرفته و به‌تدریج برای تمامی کاربران ارائه می‌شوند.

اوایل همین ماه، GPT-6 Astra را معرفی کردیم؛ هوشمندترین و همسو‌ترین مدل جهان. اگرچه پروژه‌های دشوار و حیاتی همچنان نیازمند عمق کامل Astra هستند، اما کارها در مقیاس‌ها، ریتم‌ها و بودجه‌های متفاوتی انجام می‌شوند.

به همین دلیل، ما جهان GPT-6 را با GPT-6 Sol و GPT-6 Luna گسترش می‌دهیم. GPT-6 Astra نسل جدیدی از هوش را معرفی کرد؛ این مدل‌ها با پیشبرد مرزهای بهره‌وری هزینه، به توزیع منافع آن هوش کمک می‌کنند. ما GPT-6 Sol و Luna را با روش‌هایی مشابه GPT-6 Astra آموزش دادیم و پیشرفت‌های پشت عملکرد بی‌نظیر Astra در کار حرفه‌ای، صحت‌سنجی، کدنویسی، استفاده از کامپیوتر و همسوسازی را به مدل‌های سریع‌تر و مقرون‌به‌صرفه‌تر آوردیم.

مدل‌های GPT-6 در کل منحنی هزینه–هوش پیشتاز هستند و قابلیت‌های استثنایی را در هر سطح با زیرساختی ترکیب می‌کنند که آن‌ها را به‌طور کارآمد در مقیاس بزرگ ارائه می‌دهد. بهبودها در کشینگ و استنتاج به ما اجازه می‌دهد این مدل‌ها را با هزینه کمتری سرویس دهیم و ما این صرفه‌جویی‌ها را مستقیماً با کاهش ۵۰ درصدی قیمت API برای Sol و Luna نسبت به قیمت‌های تبلیغاتی GPT-5.6 آن‌ها به کاربران و مشتریان منتقل می‌کنیم. این بهبودها در کنار هم، هوش مصنوعی پیشرفته را برای وظایف و کاربردهای روزمره بیشتر در مقیاس بزرگ عملی می‌کنند.

قیمت‌گذاری API GPT-6

مدل

ورودی

خروجی

کاهش قیمت

GPT-6 Sol
در مقابل GPT-5.6 Sol

$4 ? $2

$20 ? $10

۵۰٪ ارزان‌تر

GPT-6 Luna
در مقابل GPT-5.6 Luna

$0.20 ? $0.10

$1.20 ? $0.50

۵۰٪ ارزان‌تر

قیمت‌ها به ازای هر ۱ میلیون توکن است.

GPT-6 Astra همچنان بهترین مدل ما در تمام جنبه‌ها باقی می‌ماند. زمانی آن را انتخاب کنید که به بهترین نتایج و تجربه‌ای بدون مصالحه نیاز دارید.

گامی رو به جلو در کل خانواده مدل‌ها

GPT-6 Sol و Luna ارتقای هوش و بهره‌وری هزینه را به مدل‌هایی که از قبل می‌شناسید و استفاده می‌کنید، در قابلیت‌هایی که برای انجام کارهای پیچیده مفیدتر هستند، اضافه می‌کنند.

کار حرفه‌ای

GPT-6 Sol می‌تواند وظایف کاری دشوار را بر عهده بگیرد و در عین حال با محدودیت‌های استفاده بالاتر و هزینه کمتر، فضای بیشتری برای تکرار به شما بدهد و در مقایسه با مدل‌های رقبا با قیمت مشابه، هوش بیشتر و نتایج بهتری ارائه دهد.

در AutomationBench، آزمونی برای جریان‌های کاری کسب‌وکار در اپلیکیشن‌های مختلف، GPT-6 Sol با تلاش بسیار بالا (xhigh effort) عملکرد بهتری از Claude Opus 5 با حداکثر تلاش دارد، در حالی که هزینه آن تنها ۹٪ از هزینه هر تسک Opus 5 است. در سطح تلاش بالا (high effort)، GPT-6 Luna نسبت به نسخه قبلی خود ۵.۴ واحد درصد بهبود یافته است، در حالی که هزینه هر تسک آن ۵۸٪ کمتر است.

GPT-6 Sol همچنین با هزینه بسیار پایین‌تر از Claude Fable 5.1 بهتر عمل می‌کند و حتی GPT-6 Astra با تلاش کم را نیز شکست می‌دهد.

مدل (و سطح تلاش)

امتیاز

هزینه هر تسک

GPT-6 Sol (xhigh)

۳۳.۲٪

$0.27

GPT-6 Astra (low)

۳۰.۳٪

۳.۹ برابر GPT-6 Sol

Claude Opus 5 (max)

۲۶.۹٪

۱۱.۱ برابر GPT-6 Sol

Claude Fable 5.1 w/ Opus 5 Fallback (max)

۳۱.۴٪

>۸.۹ برابر GPT-6 Sol

(هزینه fallback گزارش نشده است)

در آزمون Agents’ Last Exam که عامل‌ها را در جریان‌های کاری حرفه‌ای پیچیده ارزیابی می‌کند، GPT-6 Sol با حداکثر تلاش امتیاز ۵۶.۴٪ را کسب می‌کند که بالاتر از بالاترین امتیاز Claude Opus 5 در این ارزیابی است، در حالی که هزینه هر تسک آن ۶۰٪ کمتر است.

صحت‌سنجی اطلاعات

مفید بودن یک پاسخ به درست بودن حقایق بستگی دارد و ما همچنان در جهت قابلیت اطمینان واقعی پیشرفت می‌کنیم. در ارزیابی داخلی صحت‌سنجی ما، که بر اساس مکالمات ناشناس واقعی از دنیای خارج است که کاربران اشتباهات مدل‌های ما را علامت‌گذاری کرده‌اند، GPT-6 Sol تقریباً نصف اشتباهات نسخه قبلی خود را مرتکب می‌شود و به قابلیت اطمینان سطح Astra با هزینه بسیار کمتر نزدیک می‌شود. GPT-6 Luna نیز بهبود چشمگیری داشته است؛ در سطوح تلاش بالاتر، عملکردی مشابه GPT-5.6 Sol ارائه می‌دهد، در حالی که هزینه آن حدود یک‌صدیم آن است.

کدنویسی

امسال، عامل‌های کدنویسی شروع به انجام وظایفی با پیچیدگی، دامنه و مدت زمان بیشتر از همیشه کرده‌اند. در OpenAI، استفاده داخلی ما به‌طور نمایی رشد کرده است. ارزش مصرف روزانه توکن‌ها بر اساس قیمت‌های API برای محققان میانی بیش از ۶۰۰ دلار و برای محققان در صدک ۹۰ ام بیش از ۷۰۰۰ دلار است (شتاب تحقیقاتی: نگاهی به داخل OpenAI). با طولانی‌تر و سخت‌گیرانه‌تر شدن وظایف عامل‌های کدنویسی، هزینه استفاده پایدار اهمیت بیشتری پیدا می‌کند. GPT-6 Sol و Luna عملکرد قوی کدنویسی را با قیمت‌های پایین‌تر API ترکیب می‌کنند و به توسعه‌دهندگان فضای بیشتری برای تکرار و به تیم‌ها اعتماد به نفس بیشتری برای بلندپروازی در خواسته‌هایشان از Codex می‌دهند.

در FrontierCode که ارزیابی می‌کند آیا عامل‌های کدنویسی تغییرات آماده ادغام در پایگاه‌های کد واقعی تولید می‌کنند یا خیر، GPT-6 Sol بهبود چشمگیری نسبت به GPT-5.6 Sol دارد و قادر است عملکردی مشابه Claude Fable 5.1 xhigh را با هزینه بسیار کمتر ارائه دهد.

در DeepSWE v1.1 که عملکرد را در وظایف پیچیده مهندسی نرم‌افزار در پایگاه‌های کد واقعی آزمایش می‌کند، GPT-6 Sol با حداکثر تلاش امتیاز ۶۸.۸٪ را کسب می‌کند که تنها ۱.۱ واحد درصد با بالاترین امتیاز Claude Fable 5 در ارزیابی فاصله دارد (۶۹.۹٪ با تلاش xhigh)، در حالی که هزینه هر تسک آن تقریباً ۸۰٪ کمتر است.

GPT-6 Luna با حداکثر تلاش امتیاز ۶۶.۶٪ را کسب می‌کند که قابل مقایسه با Claude Opus 5 و Fable 5 با تلاش متوسط است. در این مقایسه‌ها، هزینه هر تسک Luna ۹۳٪ کمتر از Opus 5 و ۹۶٪ کمتر از Fable 5 است.

استفاده از کامپیوتر

اگرچه GPT-6 Astra همچنان بهترین مدل جهان برای استفاده از کامپیوتر است، GPT-6 Sol و Luna عملکرد مقرون‌به‌صرفه‌تری نسبت به نسخه‌های قبلی خود ارائه می‌دهند. در OSWorld 2.0 offline، GPT-6 Sol با تلاش xhigh امتیازی مشابه Claude Opus 5 با تلاش متوسط کسب می‌کند (۶۰.۵٪ در مقابل ۶۰.۳٪)، در حالی که هزینه هر تسک آن تقریباً ۸۰٪ کمتر است. GPT-6 Luna (max) قادر است GPT-5.6 Sol (medium) را با یک‌دهم هزینه آن شکست دهد.

سبک همکاری

ما سبک ارتباطی بهبودیافته GPT-6 Astra را نیز به Sol و Luna آورده‌ایم که فکر می‌کنیم به‌ویژه در مکالمات فنی و کدنویسی محسوس خواهد بود. انتظار شفافیت بیشتر، اصطلاحات تخصصی کمتر، عبارات عجیب کمتر، جزئیات کم‌ارزش کمتر و پاسخ‌های کلی کوتاه‌تر را بدون از دست دادن محتوا داشته باشید.

پرامپت: وب‌سایت تمیز به نظر می‌رسد! آیا می‌توانیم از سبک طراحی Bento Box استفاده کنیم و یک اسلایدر بین صفحات در گوشه بالا سمت راست اضافه کنیم؟ ممکن است لازم باشد وارد React شوید..

GPT-5.6 Sol: قطعاً. من می‌توانم حس بنتو و سوییچر صفحه لغزنده بالای سمت راست را بدون وارد کردن React ایجاد کنم—تعامل به اندازه کافی کوچک است تا در سایت فعلی سریع و روان باقی بماند. من در حال حاضر هر چهار صفحه را حول آن سیستم بازطراحی می‌کنم.


انجام شد — سایت زنده را باز کنید.

اکنون دارای چیدمان رنگارنگ جعبه بنتو در هر چهار صفحه و یک اسلایدر انیمیشنی Home / Play / Place / Taste در گوشه بالا سمت راست است. React ضروری نبود؛ انتقال‌های صفحه بومی آن را سبک و روان نگه می‌دارند.

ابلاغ تصویر داخلی هنر غذایی را ایجاد کرد. پرامپت: «یک تصویرسازی ویرایشی پرانرژی با گواش و جوهر که دامپلینگ‌ها و نودل تند را جشن می‌گیرد، با رنگ‌های روشن، بخار، ادویه و بدون متن یا لوگو.»

GPT-6 Sol: من صفحات را به یک شبکه بنتو بازطراحی می‌کنم و لینک‌های بالای سمت راست را به یک سوییچر صفحه لغزنده تبدیل می‌کنم. من سایت موجود را حفظ می‌کنم و بررسی می‌کنم که آیا آن تعامل به React نیاز دارد یا خیر قبل از تغییر تنظیمات آن.


سایت به‌روزرسانی شده زنده است. اکنون هر صفحه دارای چیدمان بازیگوش بنتو است و سوییچر صفحه بالای سمت راست بین بخش‌ها می‌لغزد. من آن را روی دسکتاپ و صفحات موبایل باریک، شامل ناوبری عقب مرورگر، بررسی کردم. سایت موجود برای این مورد به React نیاز نداشت.

بهبود کشینگ برای عامل‌ها و مکالمات طولانی

در کنار قیمت‌های پایین‌تر توکن، ما به توسعه‌دهندگانی که روی GPT-6 کار می‌کنند کمک می‌کنیم تا در زمینه‌ای که اپلیکیشن‌هایشان بازاستفاده می‌کنند، بیشتر صرفه‌جویی کنند. ما کشینگ پرامپت را برای GPT-6 بهبود داده‌ایم تا به‌طور پیش‌فرض نرخ اصابت کش (Cache hit rates) بالاتری ارائه دهد و به عامل‌ها کمک کند تا زمینه بیشتری را بازاستفاده کنند، سریع‌تر پاسخ دهند و از تخفیف ۹۰ درصدی خواندن توکن‌های ورودی کش‌شده بهره‌مند شوند.

توسعه‌دهندگان همچنین راه‌های بیشتری برای اندازه‌گیری و بهینه‌سازی عملکرد کشینگ خود دارند:

  • نظارت و تشخیص. داشبورد کشینگ پرامپت نشان می‌دهد چه مقدار ورودی کش شده و چگونه با گذشت زمان تغییر می‌کند. ابزار تشخیص به توضیح فرصت‌های از دست رفته برای کشینگ و آنچه باید اصلاح شود کمک می‌کند.

  • تنظیم تلاش استدلال و دسترسی ابزار بدون شکستن کش. تلاش استدلال را برای وظایف سخت‌تر افزایش دهید یا برای پیگیری‌های ساده‌تر کاهش دهید و ابزارها را فعال یا غیرفعال کنید زیرا نیازهای عامل شما تغییر می‌کند. هر دو کنترل اکنون زمینه قبلی را برای بازاستفاده کش حفظ می‌کنند.

  • بهینه‌سازی کدام پیشوندها کش می‌شوند. نقاط توقف صریح به توسعه‌دهندگان اجازه می‌دهد انتخاب کنند که پیشوندهای پرامپت کش‌شده کجا پایان می‌یابند. این امر کنترل بیشتری بر بازاستفاده کش به توسعه‌دهندگان می‌دهد و می‌تواند عملکرد را بهبود بخشد.

GitHub گزارش می‌دهد که در چند ماه گذشته، این بهبودها سهم توکن‌های پرامپت که نیاز به پردازش تازه دارند را بیش از ۵۰٪ در میلیاردها درخواست به مدل‌های OpenAI کاهش داده است و به Copilot کمک کرده است سریع‌تر پاسخ دهد.

ادامه بهبود همسوسازی

GPT-6 Sol و Luna بر پایه کارهای همسوسازی معرفی‌شده با Astra، همسو‌ترین مدل ما تا کنون، بنا شده‌اند. در ارزیابی‌های همسوسازی ما، هر دو Sol و Luna نسبت به همتایان GPT-5.6 خود بهبودهایی نشان می‌دهند، از جمله نرخ‌های پایین‌تر ادعاهای گمراه‌کننده درباره کار کدنویسی‌شان.

ارزیابی‌های زیر عمداً موقعیت‌های چالش‌برانگیز را آزمایش می‌کنند و نرخ شکست را در استفاده معمولی اندازه‌گیری نمی‌کنند. برای نتایج کامل، کارت سیستم را ببینید.

دسترسی

GPT-6 Sol و GPT-6 Luna از امروز در ChatGPT Work و Codex برای همه کاربران Plus، Pro، Business، Enterprise و Edu در دسترس هستند. کاربران رایگان و Go می‌توانند به GPT-6 Luna در اپلیکیشن دسکتاپ دسترسی داشته باشند. این مدل‌ها هنوز در Chat در دسترس نیستند. در API OpenAI، آن‌ها به صورت gpt-6-sol و gpt-6-luna در دسترس هستند.

برای حفظ ثبات خدمات برای همه، ما قصد داریم این مدل‌ها را به‌تدریج در طول روز در ChatGPT عرضه کنیم. اگر مدل‌های جدید را در ChatGPT Work یا Codex نمی‌بینید، لطفاً بعداً دوباره امتحان کنید.


ارزیابی‌های GPT در محیط تحقیقاتی ما یا از طریق API ما انجام شده است که ممکن است به دلیل تفاوت‌ها در پرامپت‌های سیستم، ابزارهای موجود و غیره، خروجی کمی متفاوت از ChatGPT تولید شده ارائه دهد. ارزیابی‌های مدل‌های رقیب از گزارش‌های عمومی برداشته شده‌اند. امتیازهای Claude Fable 5 زمانی گزارش شدند که امتیازهای Claude Fable 5.1 در دسترس نبودند.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: openai.com