اوایل همین ماه، GPT-6 Astra را معرفی کردیم؛ هوشمندترین و همسوترین مدل جهان. اگرچه پروژههای دشوار و حیاتی همچنان نیازمند عمق کامل Astra هستند، اما کارها در مقیاسها، ریتمها و بودجههای متفاوتی انجام میشوند.
به همین دلیل، ما جهان GPT-6 را با GPT-6 Sol و GPT-6 Luna گسترش میدهیم. GPT-6 Astra نسل جدیدی از هوش را معرفی کرد؛ این مدلها با پیشبرد مرزهای بهرهوری هزینه، به توزیع منافع آن هوش کمک میکنند. ما GPT-6 Sol و Luna را با روشهایی مشابه GPT-6 Astra آموزش دادیم و پیشرفتهای پشت عملکرد بینظیر Astra در کار حرفهای، صحتسنجی، کدنویسی، استفاده از کامپیوتر و همسوسازی را به مدلهای سریعتر و مقرونبهصرفهتر آوردیم.
مدلهای GPT-6 در کل منحنی هزینه–هوش پیشتاز هستند و قابلیتهای استثنایی را در هر سطح با زیرساختی ترکیب میکنند که آنها را بهطور کارآمد در مقیاس بزرگ ارائه میدهد. بهبودها در کشینگ و استنتاج به ما اجازه میدهد این مدلها را با هزینه کمتری سرویس دهیم و ما این صرفهجوییها را مستقیماً با کاهش ۵۰ درصدی قیمت API برای Sol و Luna نسبت به قیمتهای تبلیغاتی GPT-5.6 آنها به کاربران و مشتریان منتقل میکنیم. این بهبودها در کنار هم، هوش مصنوعی پیشرفته را برای وظایف و کاربردهای روزمره بیشتر در مقیاس بزرگ عملی میکنند.
قیمتگذاری API GPT-6
مدل | ورودی | خروجی | کاهش قیمت |
GPT-6 Sol | $4 ? $2 | $20 ? $10 | ۵۰٪ ارزانتر |
GPT-6 Luna | $0.20 ? $0.10 | $1.20 ? $0.50 | ۵۰٪ ارزانتر |
قیمتها به ازای هر ۱ میلیون توکن است.
GPT-6 Astra همچنان بهترین مدل ما در تمام جنبهها باقی میماند. زمانی آن را انتخاب کنید که به بهترین نتایج و تجربهای بدون مصالحه نیاز دارید.
گامی رو به جلو در کل خانواده مدلها
GPT-6 Sol و Luna ارتقای هوش و بهرهوری هزینه را به مدلهایی که از قبل میشناسید و استفاده میکنید، در قابلیتهایی که برای انجام کارهای پیچیده مفیدتر هستند، اضافه میکنند.
کار حرفهای
GPT-6 Sol میتواند وظایف کاری دشوار را بر عهده بگیرد و در عین حال با محدودیتهای استفاده بالاتر و هزینه کمتر، فضای بیشتری برای تکرار به شما بدهد و در مقایسه با مدلهای رقبا با قیمت مشابه، هوش بیشتر و نتایج بهتری ارائه دهد.
در AutomationBench، آزمونی برای جریانهای کاری کسبوکار در اپلیکیشنهای مختلف، GPT-6 Sol با تلاش بسیار بالا (xhigh effort) عملکرد بهتری از Claude Opus 5 با حداکثر تلاش دارد، در حالی که هزینه آن تنها ۹٪ از هزینه هر تسک Opus 5 است. در سطح تلاش بالا (high effort)، GPT-6 Luna نسبت به نسخه قبلی خود ۵.۴ واحد درصد بهبود یافته است، در حالی که هزینه هر تسک آن ۵۸٪ کمتر است.
GPT-6 Sol همچنین با هزینه بسیار پایینتر از Claude Fable 5.1 بهتر عمل میکند و حتی GPT-6 Astra با تلاش کم را نیز شکست میدهد.
مدل (و سطح تلاش) | امتیاز | هزینه هر تسک |
|---|---|---|
GPT-6 Sol (xhigh) | ۳۳.۲٪ | $0.27 |
GPT-6 Astra (low) | ۳۰.۳٪ | ۳.۹ برابر GPT-6 Sol |
Claude Opus 5 (max) | ۲۶.۹٪ | ۱۱.۱ برابر GPT-6 Sol |
Claude Fable 5.1 w/ Opus 5 Fallback (max) | ۳۱.۴٪ | >۸.۹ برابر GPT-6 Sol (هزینه fallback گزارش نشده است) |
در آزمون Agents’ Last Exam که عاملها را در جریانهای کاری حرفهای پیچیده ارزیابی میکند، GPT-6 Sol با حداکثر تلاش امتیاز ۵۶.۴٪ را کسب میکند که بالاتر از بالاترین امتیاز Claude Opus 5 در این ارزیابی است، در حالی که هزینه هر تسک آن ۶۰٪ کمتر است.
صحتسنجی اطلاعات
مفید بودن یک پاسخ به درست بودن حقایق بستگی دارد و ما همچنان در جهت قابلیت اطمینان واقعی پیشرفت میکنیم. در ارزیابی داخلی صحتسنجی ما، که بر اساس مکالمات ناشناس واقعی از دنیای خارج است که کاربران اشتباهات مدلهای ما را علامتگذاری کردهاند، GPT-6 Sol تقریباً نصف اشتباهات نسخه قبلی خود را مرتکب میشود و به قابلیت اطمینان سطح Astra با هزینه بسیار کمتر نزدیک میشود. GPT-6 Luna نیز بهبود چشمگیری داشته است؛ در سطوح تلاش بالاتر، عملکردی مشابه GPT-5.6 Sol ارائه میدهد، در حالی که هزینه آن حدود یکصدیم آن است.
کدنویسی
امسال، عاملهای کدنویسی شروع به انجام وظایفی با پیچیدگی، دامنه و مدت زمان بیشتر از همیشه کردهاند. در OpenAI، استفاده داخلی ما بهطور نمایی رشد کرده است. ارزش مصرف روزانه توکنها بر اساس قیمتهای API برای محققان میانی بیش از ۶۰۰ دلار و برای محققان در صدک ۹۰ ام بیش از ۷۰۰۰ دلار است (شتاب تحقیقاتی: نگاهی به داخل OpenAI). با طولانیتر و سختگیرانهتر شدن وظایف عاملهای کدنویسی، هزینه استفاده پایدار اهمیت بیشتری پیدا میکند. GPT-6 Sol و Luna عملکرد قوی کدنویسی را با قیمتهای پایینتر API ترکیب میکنند و به توسعهدهندگان فضای بیشتری برای تکرار و به تیمها اعتماد به نفس بیشتری برای بلندپروازی در خواستههایشان از Codex میدهند.
در FrontierCode که ارزیابی میکند آیا عاملهای کدنویسی تغییرات آماده ادغام در پایگاههای کد واقعی تولید میکنند یا خیر، GPT-6 Sol بهبود چشمگیری نسبت به GPT-5.6 Sol دارد و قادر است عملکردی مشابه Claude Fable 5.1 xhigh را با هزینه بسیار کمتر ارائه دهد.
در DeepSWE v1.1 که عملکرد را در وظایف پیچیده مهندسی نرمافزار در پایگاههای کد واقعی آزمایش میکند، GPT-6 Sol با حداکثر تلاش امتیاز ۶۸.۸٪ را کسب میکند که تنها ۱.۱ واحد درصد با بالاترین امتیاز Claude Fable 5 در ارزیابی فاصله دارد (۶۹.۹٪ با تلاش xhigh)، در حالی که هزینه هر تسک آن تقریباً ۸۰٪ کمتر است.
GPT-6 Luna با حداکثر تلاش امتیاز ۶۶.۶٪ را کسب میکند که قابل مقایسه با Claude Opus 5 و Fable 5 با تلاش متوسط است. در این مقایسهها، هزینه هر تسک Luna ۹۳٪ کمتر از Opus 5 و ۹۶٪ کمتر از Fable 5 است.
استفاده از کامپیوتر
اگرچه GPT-6 Astra همچنان بهترین مدل جهان برای استفاده از کامپیوتر است، GPT-6 Sol و Luna عملکرد مقرونبهصرفهتری نسبت به نسخههای قبلی خود ارائه میدهند. در OSWorld 2.0 offline، GPT-6 Sol با تلاش xhigh امتیازی مشابه Claude Opus 5 با تلاش متوسط کسب میکند (۶۰.۵٪ در مقابل ۶۰.۳٪)، در حالی که هزینه هر تسک آن تقریباً ۸۰٪ کمتر است. GPT-6 Luna (max) قادر است GPT-5.6 Sol (medium) را با یکدهم هزینه آن شکست دهد.
سبک همکاری
ما سبک ارتباطی بهبودیافته GPT-6 Astra را نیز به Sol و Luna آوردهایم که فکر میکنیم بهویژه در مکالمات فنی و کدنویسی محسوس خواهد بود. انتظار شفافیت بیشتر، اصطلاحات تخصصی کمتر، عبارات عجیب کمتر، جزئیات کمارزش کمتر و پاسخهای کلی کوتاهتر را بدون از دست دادن محتوا داشته باشید.
پرامپت: وبسایت تمیز به نظر میرسد! آیا میتوانیم از سبک طراحی Bento Box استفاده کنیم و یک اسلایدر بین صفحات در گوشه بالا سمت راست اضافه کنیم؟ ممکن است لازم باشد وارد React شوید..
GPT-5.6 Sol: قطعاً. من میتوانم حس بنتو و سوییچر صفحه لغزنده بالای سمت راست را بدون وارد کردن React ایجاد کنم—تعامل به اندازه کافی کوچک است تا در سایت فعلی سریع و روان باقی بماند. من در حال حاضر هر چهار صفحه را حول آن سیستم بازطراحی میکنم.
انجام شد — سایت زنده را باز کنید.
اکنون دارای چیدمان رنگارنگ جعبه بنتو در هر چهار صفحه و یک اسلایدر انیمیشنی Home / Play / Place / Taste در گوشه بالا سمت راست است. React ضروری نبود؛ انتقالهای صفحه بومی آن را سبک و روان نگه میدارند.
ابلاغ تصویر داخلی هنر غذایی را ایجاد کرد. پرامپت: «یک تصویرسازی ویرایشی پرانرژی با گواش و جوهر که دامپلینگها و نودل تند را جشن میگیرد، با رنگهای روشن، بخار، ادویه و بدون متن یا لوگو.»
GPT-6 Sol: من صفحات را به یک شبکه بنتو بازطراحی میکنم و لینکهای بالای سمت راست را به یک سوییچر صفحه لغزنده تبدیل میکنم. من سایت موجود را حفظ میکنم و بررسی میکنم که آیا آن تعامل به React نیاز دارد یا خیر قبل از تغییر تنظیمات آن.
سایت بهروزرسانی شده زنده است. اکنون هر صفحه دارای چیدمان بازیگوش بنتو است و سوییچر صفحه بالای سمت راست بین بخشها میلغزد. من آن را روی دسکتاپ و صفحات موبایل باریک، شامل ناوبری عقب مرورگر، بررسی کردم. سایت موجود برای این مورد به React نیاز نداشت.
بهبود کشینگ برای عاملها و مکالمات طولانی
در کنار قیمتهای پایینتر توکن، ما به توسعهدهندگانی که روی GPT-6 کار میکنند کمک میکنیم تا در زمینهای که اپلیکیشنهایشان بازاستفاده میکنند، بیشتر صرفهجویی کنند. ما کشینگ پرامپت را برای GPT-6 بهبود دادهایم تا بهطور پیشفرض نرخ اصابت کش (Cache hit rates) بالاتری ارائه دهد و به عاملها کمک کند تا زمینه بیشتری را بازاستفاده کنند، سریعتر پاسخ دهند و از تخفیف ۹۰ درصدی خواندن توکنهای ورودی کششده بهرهمند شوند.
توسعهدهندگان همچنین راههای بیشتری برای اندازهگیری و بهینهسازی عملکرد کشینگ خود دارند:
نظارت و تشخیص. داشبورد کشینگ پرامپت نشان میدهد چه مقدار ورودی کش شده و چگونه با گذشت زمان تغییر میکند. ابزار تشخیص به توضیح فرصتهای از دست رفته برای کشینگ و آنچه باید اصلاح شود کمک میکند.
تنظیم تلاش استدلال و دسترسی ابزار بدون شکستن کش. تلاش استدلال را برای وظایف سختتر افزایش دهید یا برای پیگیریهای سادهتر کاهش دهید و ابزارها را فعال یا غیرفعال کنید زیرا نیازهای عامل شما تغییر میکند. هر دو کنترل اکنون زمینه قبلی را برای بازاستفاده کش حفظ میکنند.
بهینهسازی کدام پیشوندها کش میشوند. نقاط توقف صریح به توسعهدهندگان اجازه میدهد انتخاب کنند که پیشوندهای پرامپت کششده کجا پایان مییابند. این امر کنترل بیشتری بر بازاستفاده کش به توسعهدهندگان میدهد و میتواند عملکرد را بهبود بخشد.
GitHub گزارش میدهد که در چند ماه گذشته، این بهبودها سهم توکنهای پرامپت که نیاز به پردازش تازه دارند را بیش از ۵۰٪ در میلیاردها درخواست به مدلهای OpenAI کاهش داده است و به Copilot کمک کرده است سریعتر پاسخ دهد.
ادامه بهبود همسوسازی
GPT-6 Sol و Luna بر پایه کارهای همسوسازی معرفیشده با Astra، همسوترین مدل ما تا کنون، بنا شدهاند. در ارزیابیهای همسوسازی ما، هر دو Sol و Luna نسبت به همتایان GPT-5.6 خود بهبودهایی نشان میدهند، از جمله نرخهای پایینتر ادعاهای گمراهکننده درباره کار کدنویسیشان.
ارزیابیهای زیر عمداً موقعیتهای چالشبرانگیز را آزمایش میکنند و نرخ شکست را در استفاده معمولی اندازهگیری نمیکنند. برای نتایج کامل، کارت سیستم را ببینید.
دسترسی
GPT-6 Sol و GPT-6 Luna از امروز در ChatGPT Work و Codex برای همه کاربران Plus، Pro، Business، Enterprise و Edu در دسترس هستند. کاربران رایگان و Go میتوانند به GPT-6 Luna در اپلیکیشن دسکتاپ دسترسی داشته باشند. این مدلها هنوز در Chat در دسترس نیستند. در API OpenAI، آنها به صورت gpt-6-sol و gpt-6-luna در دسترس هستند.
برای حفظ ثبات خدمات برای همه، ما قصد داریم این مدلها را بهتدریج در طول روز در ChatGPT عرضه کنیم. اگر مدلهای جدید را در ChatGPT Work یا Codex نمیبینید، لطفاً بعداً دوباره امتحان کنید.
ارزیابیهای GPT در محیط تحقیقاتی ما یا از طریق API ما انجام شده است که ممکن است به دلیل تفاوتها در پرامپتهای سیستم، ابزارهای موجود و غیره، خروجی کمی متفاوت از ChatGPT تولید شده ارائه دهد. ارزیابیهای مدلهای رقیب از گزارشهای عمومی برداشته شدهاند. امتیازهای Claude Fable 5 زمانی گزارش شدند که امتیازهای Claude Fable 5.1 در دسترس نبودند.