اشتراک
نموداری که نشان می‌دهد مدل کلود اکنون هدایت ۲۶ درصد از وظایف تحقیق و توسعه مدل‌های آنتروپیک را بر عهده دارد، در حالی که این رقم در فوریه ۲۰۲۶ کمتر از ۱ درصد بود.
نموداری که نشان می‌دهد مدل کلود اکنون هدایت ۲۶ درصد از وظایف تحقیق و توسعه مدل‌های آنتروپیک را بر عهده دارد، در حالی که این رقم در فوریه ۲۰۲۶ کمتر از ۱ درصد بود.
هوش مصنوعی سیاست‌گذاری فناوری

شاخص‌هایی برای درک سرعت توسعه هوش مصنوعی در آزمایشگاه‌های پیشرو

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

این گزارش به معرفی شاخص‌هایی برای سنجش سرعت توسعه هوش مصنوعی در آزمایشگاه‌های پیشرو می‌پردازد تا شفافیت بیشتری برای افکار عمومی و نهادهای نظارتی فراهم کند. تمرکز اصلی این چارچوب بر سه محور حیاتی است: نخست، میزان سهم هوش مصنوعی در فرایند توسعه مدل‌های جدید (توسعه هوش مصنوعی با هدایت هوش مصنوعی)؛ دوم، نحوه نظارت و مداخله در عملکرد عامل‌های هوش مصنوعی (AI agents)؛ و سوم، میزان تخصیص توان پردازشی به پژوهش‌های ایمنی. در بخش نخست، آنتروپیک با استفاده از مقیاس «سطح خودکارسازی» (AL)، فعالیت‌های تحقیق و توسعه خود را ارزیابی کرده است. طبق داده‌های اوت ۲۰۲۶، مدل «کلود» در حالی که هنوز به‌صورت کاملاً خودمختار عمل نمی‌کند، اما در ۲۶ درصد از فعالیت‌های تحقیق و توسعه نقش «هدایتگر» را بر عهده دارد و بیش از ۹۰ درصد فعالیت‌ها در سطوح «همکاری» یا بالاتر انجام می‌شوند. این شاخص‌ها برای درک فاصله تا «خودبهبودبخشی بازگشتی» ضروری هستند. در محور دوم، سیستم‌های پایش برخط و برون‌خط برای نظارت بر ده‌ها هزار عامل هوش مصنوعی طراحی شده‌اند. پایشگرهای برخط تمامی اقدامات را در لحظه بررسی کرده و نرخ بسیار ناچیزی از مسدودسازی (۰.۰۰۲ درصد) را ثبت کرده‌اند، در حالی که پایشگرهای برون‌خط برای شناسایی رفتارهای خطرناک بلندمدت فعالیت می‌کنند. در نهایت، تحلیل تخصیص توان پردازشی نشان می‌دهد که حدود ۶ تا ۱۲ درصد از توان محاسباتی تحقیق و توسعه آنتروپیک به حوزه ایمنی اختصاص یافته است. این گزارش با تأکید بر اینکه تفکیک ایمنی از توسعه توانمندی‌ها چالش‌برانگیز است، پیشنهاد می‌دهد که آزمایشگاه‌های پیشرو با انتشار منظم و استاندارد این شاخص‌ها و بهره‌گیری از ارزیابان مستقل، بستری برای نظارت مسئولانه و تصمیم‌گیری‌های آگاهانه جهانی فراهم کنند. این اقدامات گامی آغازین برای کنترل شتاب توسعه و هم‌راستاسازی مدل‌ها با نیازهای ایمنی بشر محسوب می‌شود.

سامانه‌های هوش مصنوعی با شتابی تصاعدی در حال قدرتمندتر شدن هستند و بخش‌های بیشتری از فرایند ساخت خود را به‌صورت خودکار انجام می‌دهند. در شرایطی که جهان موضوع تعدیل سرعت توسعه هوش مصنوعی پیشرو (Frontier AI) را مورد بررسی قرار داده است، افکار عمومی به اطلاعات بیشتری در این زمینه نیاز دارند.

در این گزارش، ابزارهای سنجشی را معرفی می‌کنیم که می‌توانند سه جنبه حیاتی از توسعه هوش مصنوعی را روشن سازند:

  1. میزان نقش هوش مصنوعی در ساخت نسخه بعدی خود در مقایسه با فرایند ساخت توسط انسان‌ها
  2. توانایی ما در نظارت و مداخله در اقداماتی که عامل‌های هوش مصنوعی (AI agents) در سامانه‌های آنتروپیک انجام می‌دهند
  3. منابعی که توان توسعه مدل‌های توانمندتر را تأمین می‌کنند

ما همچنین تصویری آماری از این معیارها را از درون آنتروپیک ارائه می‌دهیم. شایان ذکر است انتظار داریم در صورت هماهنگی جمعی پیرامون تعیین سرعت پیشرفت سامانه‌های پیشرو — همان‌گونه که داریو آمودی مدیرعامل آنتروپیک خواستار آن شده است — این ارقام تغییر یابند. ما در نظر داریم ارزیابان مستقل شخص ثالث از چندین سازمان را در آنتروپیک مستقر کرده و دسترسی به فرایندها، سامانه‌ها و داده‌های داخلی را در سطحی معادل تیم‌های ارزیابی ریسک داخلی برای آن‌ها فراهم کنیم. این نهادهای شخص ثالث، رویه‌های ایمنی را راستی‌آزمایی کرده، حوادث را گزارش داده و شاخص‌های کلیدی مانند موارد مطرح‌شده در این مطلب را پایش خواهند کرد.

ما این داده‌های سنجش را منتشر می‌کنیم زیرا دید روشن‌تری نسبت به سرعت توسعه هوش مصنوعی در آزمایشگاه‌های پیشرو برای افکار عمومی، نهادهای ثالث و دولت‌ها فراهم می‌آورند. در هر بخش، تشریح کرده‌ایم که چه معیاری سنجیده شده، چه نتایجی به دست آمده و برای انتشار منظم و قابل راستی‌آزمایی این شاخص‌ها چه اقداماتی لازم است. جزئیات روش‌شناختی در بخش پیوست ارائه شده است.

دلایل پیگیری و رصد این شاخص‌ها

شاخص‌های ارائه‌شده در این مقاله بر نحوه ساخت مدل‌ها متمرکز هستند. با درک بهتر فرایند تولید مدل‌ها، می‌توانیم ورودی‌های مدل مانند توان پردازشی (Compute) را به شکل دقیق‌تری با خروجی‌های آن نظیر توانمندی‌ها همبسته سازیم. این شاخص‌ها مکمل ارزیابی توانمندی‌ها هستند که کارهایی که مدل‌ها قادر به انجام آن هستند را می‌سنجند. ما این ارزیابی‌ها را به‌صورت جداگانه در قالب گزارش‌های ریسک «سیاست مقیاس‌پذیری مسئولانه» (RSP) منتشر می‌کنیم که حاوی شواهدی پیرامون میزان شتاب‌بخشی مدل‌هایمان به تحقیق و توسعه هوش مصنوعی است. ما در پیشنهاد سیاستی خود پیرامون هوش مصنوعی پیشرفته تحت عنوان «چارچوب هوش مصنوعی پیشرفته» (AAIF)، مقرراتی برای انتشار ایمن مدل‌ها توسط همه آزمایشگاه‌ها پیشنهاد داده‌ایم که الزامات شفافیت دولتی همچون ارائه گزارش‌های ریسک را نیز در بر می‌گیرد. این سنجه‌ها و سیاست‌های پیشنهادی، چارچوبی آغازین برای نظارت بر روند توسعه هوش مصنوعی از بیرون آزمایشگاه‌ها به شمار می‌روند.

(۱) سنجش تحقیق و توسعه هوش مصنوعی با هدایت هوش مصنوعی

چرا تحقیق و توسعه مبتنی بر هوش مصنوعی را می‌سنجیم؟ آزمایشگاه‌های پیشرو به‌طور فزاینده‌ای از هوش مصنوعی برای ساخت مدل‌های آینده بهره می‌برند. این روند به آزمایشگاه‌های کشورهای دموکراتیک اجازه می‌دهد مدل‌های توانمندتر را سریع‌تر توسعه داده و آزمون‌های ایمنی بیشتری را پیش از انتشار به اجرا بگذارند تا هم‌زمان با حفظ جایگاه در مرزهای فناوری، مزایای آن را تضمین کنند. با این حال، شتاب‌بخشی مدل‌ها به فرایند توسعه خود می‌تواند درک و کنترل این سامانه‌ها را برای انسان‌ها دشوارتر سازد. از این رو، انتشار این شاخص‌ها برای آگاهی از فاصله جهان با پدیده «خودبهبودبخشی بازگشتی» (Recursive self-improvement؛ ساخت کاملاً خودمختار یک مدل توسط نسخه پیشین) حیاتی است.

چه چیزی را سنجیدیم؟ ما نسخه اولیه‌ای از یک شاخص را برای اندازه‌گیری سهم کلود (Claude) در تحقیق و توسعه هوش مصنوعی در آنتروپیک طراحی کردیم که «شاخص خودکارسازی تحقیق و توسعه آنتروپیک» نام دارد. این شاخص با فهرست‌کردن تمامی فعالیت‌های تحقیق و توسعه هوش مصنوعی در شرکت، تعیین درجه خودکارسازی هر وظیفه و تجمیع این ارزیابی‌ها شکل گرفته است.

چه نتایجی به دست آمد؟ برای سنجش سهم هوش مصنوعی در انجام تحقیق و توسعه در آنتروپیک، از مقیاس رتبه‌بندی خودکارسازی ارائه‌شده توسط Epoch AI استفاده می‌کنیم که «سطح خودکارسازی» (Automation Level یا AL) نام دارد. این مقیاس از AL0 (عدم دخالت هوش مصنوعی) تا AL5 (عملکرد کاملاً خودمختار بدون حضور انسان) را شامل می‌شود. در سطح AL3، هوش مصنوعی «همکاری» می‌کند؛ یعنی می‌تواند بخش‌های بزرگی از کار را تحت هدایت نزدیک انسان پیش ببرد. در سطح AL4، هوش مصنوعی «هدایت» کار را در دست دارد و قادر است با دریافت دستوری کلی، بیشتر بخش‌های وظیفه را از ابتدا تا انتها به انجام رساند، در حالی که انسان تنها نقش نظارتی دارد.

تا اوت ۲۰۲۶:

  • کلود در هیچ بخش تعریف‌شده‌ای از تحقیق و توسعه هوش مصنوعی به‌صورت کاملاً خودمختار عمل نمی‌کند.
  • کلود ۲۶ درصد از فعالیت‌های تحقیق و توسعه مدل‌های آنتروپیک را «هدایت» می‌کند.
  • سهم فعالیت‌هایی که در سطح «همکاری هوش مصنوعی» یا بالاتر قرار دارند، به بیش از ۹۰ درصد رسیده است.

چه مواردی را همه توسعه‌دهندگان می‌توانند گزارش کنند؟ هر توسعه‌دهنده پیشرو می‌تواند این شاخص‌ها را به‌صورت منظم و با متدولوژی عمومی منتشر کند. این امر امکان مقایسه داده‌ها در طول زمان و میان آزمایشگاه‌های مختلف را فراهم می‌سازد.

دو مانع در مسیر مقایسه میان‌آزمایشگاهی وجود دارد: نخست، نبود یک روش‌شناسی مشترک؛ دوم، استفاده از مدل‌های خودمان برای ارزیابی سامانه‌ها که می‌تواند سبب شود مدل ارزیاب نیز خطاهایی مشابه مدل مورد بررسی مرتکب شود. برای رفع این چالش‌ها، سنجش‌های هر توسعه‌دهنده می‌تواند توسط شخص ثالث یا با مدل‌های سایر توسعه‌دهندگان راستی‌آزمایی شود، مشروط بر آنکه پروتکل‌های حفاظتی مانع از تبادل داده‌های حساس رقابتی گردند. این شاخص‌ها همچنین می‌توانند مبنایی برای الزامات سخت‌گیرانه‌تر مانند بازه آزمایشی مشخص پیش از به‌کارگیری مدل‌های جدید در تحقیق و توسعه باشند.

(۲) سنجش نظارت بر عامل‌های هوش مصنوعی

چرا نظارت بر عامل‌ها باید سنجیده شود؟ همانند سایر شرکت‌های پیشرو، کارکنان آنتروپیک به‌طور فزاینده‌ای وظایف را به عامل‌هایی واگذار می‌کنند که برای مدت‌های طولانی به‌صورت نیمه‌خودمختار عمل کرده و کارهایی را نیز به یکدیگر تفویض می‌کنند. با حرکت خودکارسازی از مرحله «همکاری» به سوی «هدایت»، عامل‌ها ممکن است تصمیم‌های اثرگذارتری اتخاذ کنند، مانند تعیین مسیر پژوهشی بعدی.

این تصمیمات به تمهیدات حفاظتی برای مسدودسازی رفتارهای زیان‌بار یک عامل مجزا و نیز سامانه‌ای نظارتی برای شناسایی مسائلی که فقط در برهم‌کنش میان چندین عامل رخ می‌دهند، نیاز دارند. در داده‌های پایش ما تا به امروز، عامل‌های منفرد به‌ندرت رفتارهای ناهنجار داشته‌اند، اما زمانی که میلیون‌ها یا میلیاردها عامل در اقتصاد فعال باشند، حتی رویدادهای نادر نیز به‌طور منظم رخ خواهند داد.

چه چیزی را سنجیدیم؟ ما سامانه‌ای طراحی کرده‌ایم که امکان نظارت و مداخله در اقدامات عامل‌های هوش مصنوعی را در پلتفرم‌های آنتروپیک فراهم می‌کند. در اینجا سه شاخص را مد نظر قرار می‌دهیم: پوشش (Coverage) که درصد اقدامات عاملی را که پیش یا پس از اجرا از پایشگر عبور می‌کنند نشان می‌دهد؛ تأخیر در بررسی (Review latency) که فاصله زمانی میان اقدام و بازبینی آن توسط پایشگر خودکار و سپس انسان است؛ و نرخ ارجاع (Escalation rate) که درصد فعالیت‌های مسدودشده، هدایت‌شده یا نشانه‌گذاری‌شده برای بازبینی بیشتر را معین می‌کند.

چه نتایجی به دست آمد؟ تا اوت ۲۰۲۶، تقریباً ۳۰ هزار عامل به‌طور هم‌زمان در پرکاربردترین پلتفرم داخلی ما مشغول فعالیت‌های پژوهشی و مهندسی بوده‌اند. این ارزیابی‌ها صرفاً به این پلتفرم محدود می‌شود. کنش‌های این عامل‌ها توسط دو گونه ناظر کنترل می‌گردد:

  • پایشگرهای برخط (Online monitors): این پایشگرها اقدامات عامل‌ها را در لحظه بررسی کرده و اقدامات خطرناک را متوقف یا رفتار عامل را اصلاح می‌کنند. این ابزارها برای جلوگیری از آسیب‌های فوری و جبران‌ناپذیر — مانند نسخه‌برداری از وزن‌های مدل به خارج از سامانه — طراحی شده‌اند. ۱۰۰ درصد اقدامات این عامل‌ها پیش از اجرا و معمولاً ظرف چند ثانیه از این پایشگر عبور می‌کنند. بررسی خودکار پیش از اقدام انجام می‌شود و انسان‌ها اقدامات مسدودشده را ظرف یک هفته بررسی می‌کنند. با تحلیل بیش از یک میلیارد تصمیم در اوت ۲۰۲۶، مشخص شد ۰.۰۰۲ درصد (حدود ۱ مورد از هر ۴۷ هزار تصمیم) توسط این سامانه مسدود شده است.
  • پایشگرهای برون‌خط (Offline monitors): این پایشگرها فعالیت‌های عامل را پس از وقوع مطالعه می‌کنند تا به مهار رفتارهای خطرناکی که به‌کندی رشد می‌کنند و قابل بازگشت هستند — مانند نشانه‌های انحراف هم‌راستایی مدل — کمک کنند. گزارش‌های نشانه‌گذاری‌شده برای بهبود روش‌های تعدیل ساز و کنترل‌های قطعی استفاده می‌شوند. ۱۰۰ درصد اقدامات پس از انجام، ثبت می‌شوند. این سامانه حدود ۱۰۰ هزار گزارش در هفته را پرچم‌گذاری می‌کند که توسط چند رده‌بندی‌کننده بازبینی می‌شوند. اولویت‌دارترین موارد (حدود ۵۰ مورد در هفته) به بازبینی انسانی ارجاع داده می‌شوند (تقریباً ۱ تا ۲ مورد در هر هزار گزارش).

آنچه یک توسعه‌دهنده هوش مصنوعی امروز می‌تواند گزارش دهد. هر شرکتی که عامل‌ها را در فرایندهای پژوهشی و مهندسی خود به کار می‌گیرد، می‌تواند شاخص‌های یکسانی را منتشر کند: پوشش، تأخیر در بررسی و نرخ ارجاع. انتشار این آمارها امکان ارزیابی همگامی نظارت با رشد نقش هوش مصنوعی را برای جامعه فراهم می‌سازد. ما همه این ارقام را در گزارش ریسک اخیر خود منتشر کرده‌ایم.

توسعه‌دهندگان باید بسامد کشف رفتارهای ناهنجار عامل‌ها را به اشتراک بگذارند و از اشخاص ثالث برای آزمون‌های مستقل بهره ببرند. پیش از این، سازمان METR به‌صورت مستقل به آزمون نفوذ و تیم قرمز پلتفرم نظارت برون‌خط ما پرداخته است و اکنون در حال استقرار ارزیابان خارجی در آنتروپیک هستیم.

(۳) سنجش تخصیص توان پردازشی

چرا تخصیص توان پردازشی را می‌سنجیم؟ توسعه‌دهندگان هوش مصنوعی از قدرت پردازشی برای ساخت مدل‌های قدرتمندتر، خدمت‌رسانی به مشتریان و پژوهش‌های متمرکز بر ایمنی مانند بررسی لایه‌های «تفکر» مدل، آموزش ریزسامانه‌ها برای مطالعه ناهماهنگی، و ارزیابی ایمنی پیش از استقرار بهره می‌گیرند. درک نحوه توزیع توان پردازشی نشان می‌دهد اولویت‌های توسعه‌دهنده به کدام سو متمایل است و این تمرکز چگونه در طول زمان دگرگون می‌شود.

علاوه بر این، توان پردازشی یکی از شفاف‌ترین و قابل‌راستی‌آزمایی‌ترین ورودی‌ها در فرایند تحقیق و توسعه هوش مصنوعی است و می‌تواند اهرم مهمی در سیاست‌گذاری‌های آینده پیرامون تنظیم شتاب پیشرفت باشد. یک تلاش هماهنگ می‌تواند شرکت‌ها را تشویق کند تا توان پردازشی اختصاص‌یافته به ایمنی، هم‌راستاسازی، تفسیرپذیری و آزمون‌های سنجش را افزایش دهند.

چه چیزی را سنجیدیم؟ ما نحوه استفاده آنتروپیک از توان پردازشی خود را از ۱۳ تا ۲۰ ژوئیه مورد بررسی قرار دادیم. بدین منظور، بار کاری پردازنده‌ها به چند دسته محدود تقسیم شد و سهم ایمنی از کل پردازش تحقیق و توسعه مشخص گردید.

پژوهش‌های ایمنی ذاتاً کمتر از دوره‌های آموزش مدل‌های پیشرو نیاز به پردازش دارند؛ از این رو توان پردازشی معیاری مطلق برای سنجش تمرکز بر ایمنی نیست، زیرا بخش عمده پژوهش‌های ایمنی به طراحی آزمایش‌ها مربوط است که زمان‌بر بوده اما نیازمند محاسبات سنگین نیست. ارزش این شاخص، امکان‌پذیر ساختن مقایسه هم‌سطح میان توسعه‌دهندگان مختلف در طول زمان است.

چه نتایجی به دست آمد؟ در هفته مورد بررسی، حدود ۶ درصد از توان پردازشی تحقیق و توسعه هوش مصنوعی و حدود ۱۲ درصد از توان پردازشی صرف‌شده در تحقیق و توسعه مبتنی بر هوش مصنوعی، به حوزه ایمنی اختصاص یافته بود.

این برآوردها کاملاً محافظه‌کارانه انجام شده است؛ به عنوان نمونه اگر داده‌ای هم‌زمان در ارتقای توانمندی و ایمنی نقش داشته، در زمره محاسبات ایمنی لحاظ نشده است. علاوه بر این، پردازش‌های مربوط به رده‌بندی‌کننده‌های حفاظتی که سهم قابل‌توجهی از پردازش را به خود اختصاص می‌دهند، در این آمار لحاظ نشده‌اند.

آنچه یک توسعه‌دهنده امروز می‌تواند گزارش دهد. هر شرکت پیشرو می‌تواند سهم توان پردازشی ایمنی خود را به همراه تعاریف دسته‌بندی‌ها منتشر کرده و راستی‌آزمایی آن را به نهادی مستقل بسپارد.

تفکیک پژوهش‌های ایمنی از توسعه توانمندی‌ها دشوار است و توسعه‌دهندگان ممکن است مرزها را با تساهل ترسیم کنند. وظیفه اثبات ایمنی‌محور بودن بر عهده خود توسعه‌دهنده است. جامعه علمی و قانون‌گذاران از همگرایی بر سر یک تعریف واحد بهره‌مند خواهند شد. چنین معیارهایی می‌تواند تعهدات آزمایشگاه‌ها پیرامون سهم پردازش ایمنی یا محدودیت‌های مربوط به عامل‌های پژوهشی را شکل دهد.

نتیجه‌گیری

هم‌زمان با بحث‌های جهانی پیرامون مدیریت شتاب توسعه هوش مصنوعی، باید شکاف اطلاعاتی میان آزمایشگاه‌ها و افکار عمومی را به حداقل برسانیم. این امر مستلزم سنجش بهتر، انتشار عمومی داده‌ها و دادن فرصت به جامعه برای تصمیم‌گیری آگاهانه است. ما امیدواریم با انتشار این شاخص‌ها، الگویی از شفافیت ارائه دهیم و به این مسیر ادامه خواهیم داد.

پیوست

در ادامه جزئیات روش‌شناختی تمامی معیارهای طراحی‌شده آورده شده است.

سنجش تحقیق و توسعه مبتنی بر هوش مصنوعی

روش انجام کار: شاخص خودکارسازی به سه مؤلفه نیازمند است: نگاشت کامل تمامی وظایف تحقیق و توسعه در آنتروپیک، شیوه‌ای برای رتبه‌بندی میزان خودکارسازی، و ساختاری برای وزن‌دهی به وظایف تا بخش‌های حیاتی‌تر وزن بیشتری داشته باشند. از آنجا که فهرست کردن دستی این وظایف در یک شرکت پیشرو ناممکن است، این فهرست با رویکردی پایین‌به‌بالا از گزارش‌های کاری اسلک (Slack) و مستندات داخلی استخراج شد.

برای هر هفته از ژوئیه ۲۰۲۶، به‌صورت تصادفی ۲۰ درصد از کارکنان بخش‌های مرتبط با چرخه تحقیق و توسعه مدل انتخاب شدند. یک عامل پژوهشی کلود، فعالیت‌های هفتگی این افراد را بر مبنای اسلک و مستندات بررسی کرده و فهرست وظایف آنان را تدوین نمود. تکرار این فرایند فهرستی مشتمل بر ۱۵ هزار وظیفه جزئی تحقیق و توسعه را ایجاد کرد. سپس با کمک کلود، این وظایف در قالب یک ساختار درختی سلسله‌مراتبی از ریشه (کل تحقیق و توسعه) تا شاخه‌های جزئی‌تر مانند پیش‌آموزش و یادگیری تقویتی دسته‌بندی شدند. ساختار حاصل دارای ۵۴۲ گره در سطوح مختلف است که ۳۷۸ مورد آن برگ‌های نهایی نظیر «رفع نقص بستر ارزیابی» یا «تحلیل حوادث سرویس‌دهی» هستند. این درخت تثبیت شده تا تمام ارزیابی‌های بعدی در بستری یکنواخت صورت پذیرد.

برای هر شاخه، عاملی از کلود به‌طور عمیق شیوه انجام کار در سراسر شرکت را بررسی می‌کند. سپس یک مدل داور مستقل، سطح خودکارسازی را طبق مقیاس Epoch AI از AL0 تا AL5 تعیین می‌کند. در زمان رتبه‌بندی هر ماه، عامل‌ها صرفاً مجاز به مشاهده داده‌های همان ماه یا پیش از آن هستند.

برای تجمیع رتبه‌ها، وزن هر گره بر مبنای میزان «نفر-ساعت» اختصاص‌یافته تعیین شد. به هر فرد در هفته یک واحد وزن تعلق گرفت که میان وظایف وی تقسیم شد. وزن هر دسته حاصل‌جمع اوزان زمانی اختصاص‌یافته به آن است. این روش اگرچه تقریب‌محور است، اما به‌طور منطقی وزن بیشتری به حوزه‌های با نیروی انسانی بیشتر اختصاص می‌دهد.

نقاط قوت و محدودیت‌های این روش: نخست، رتبه‌بندی‌ها به مدل داور وابسته‌اند. برای اعتبارسنجی، از متخصصان داخلی خواسته شد بدون آگاهی از تحلیل مدل‌ها، حوزه‌های کاری خود را رتبه‌بندی کنند. میزان توافق مدل داور با انسان‌ها با میزان توافق میان خود کارشناسان برابری می‌کرد (توافق دقیق مدل با انسان ۵۹ درصد، و انسان با انسان ۳۵ درصد بود) و در ۹۷ درصد موارد، اختلاف در حد یک سطح بود. با این حال در مرزهایی نظیر گذار از «همکاری» به «هدایت»، همواره تفاوت دیدگاه وجود دارد.

دوم اینکه سبد سنجش ثابت است. افزایش شاخص بر مبنای ژوئیه ۲۰۲۶ نشان می‌دهد کارهای انسانی آن مقطع خودکار شده‌اند، اما نشان نمی‌دهد آیا وظایف جدیدی پدید آمده‌اند یا خیر. ما برای بررسی این موضوع، درختی مبتنی بر داده‌های ژانویه ۲۰۲۶ ساختیم و متوجه افزایش معنادار وظایف نوظهور نشدیم که پایداری ساختار تحقیق و توسعه را تایید می‌کند؛ هرچند بازبینی دوره‌ای این سبد در دستور کار قرار دارد.

نظارت بر عامل‌ها

روش انجام کار: در ساختار زیربنایی عامل‌های داخلی ما، دو راهبرد اصلی برای کشف رفتارهای پیش‌بینی‌نشده و نظارت متقابل عامل‌ها به کار گرفته شده است:

  • هویت مستقل: به هر عامل یک شناسه فردی اعطا شده و تمام داده‌های تولیدی آن به این هویت متصل می‌شود. این ویژگی مانع از بروز همبستگی ناخواسته میان اقدامات شده و اجازه می‌دهد هر عامل بر پایه تجربه خود تصمیم بگیرد. هویت با تغییر مدل زیرین پایدار می‌ماند و پیوستگی پیشینه عامل حفظ می‌شود. این طراحی امکان ممیزی هر کنش را در طول زمان فراهم می‌سازد.
  • ارتباطات شفاف: عامل‌ها به جای کانال‌های خصوصی، در بستری باز پیام‌رسانی می‌کنند. همه پیام‌ها به هویت عامل فرستنده متصل بوده و به منابع اصلی ارجاع دارند که مانع از تحریف اطلاعات می‌شود. این شفافیت امکان اصلاح خطای یکدیگر و هماهنگی بهتر را مهیا می‌سازد. تمامی پیام‌ها با گزارش‌های متنی تطبیق داده شده و پایش رفتاری در بستر ارتباطات پیگیری می‌شود.

نقاط قوت و محدودیت‌ها: در مقیاس فعالیت کنونی ده‌ها هزار عامل، احاطه کامل بر تمامی رفتارهای محتمل یا قابل‌فهم‌سازی کامل آن‌ها برای ناظران انسانی دشوار است. این نظارت دانشی نوپاست و چارچوب‌های پایش عامل‌ها در آینده دستخوش تغییرات چشمگیر خواهند شد.

سنجش تخصیص توان پردازشی

روش انجام کار: ما از ابزارهای داخلی مدیریت ظرفیت آغاز کردیم که به‌طور منظم میزان مصرف پردازنده‌ها و برچسب‌های کاری را پایش می‌کنند. داده‌های پردازش ابری شخص ثالث نیز ادغام شدند. سپس با استفاده از کلود، هر بار پردازشی به دو دسته پژوهش‌های ایمنی یا توسعه عمومی تقسیم شد. کارهای ارتقادهنده ایمنی شامل مواردی است که هدف غالب آن‌ها افزایش امنیت، شفافیت یا درک سامانه‌ها باشد، و مابقی موارد در زمره توسعه عمومی دسته‌بندی شدند.

برای فرآیندهای آموزشی و ارزیابی، یک رده‌بندی‌کننده با خواندن فراداده و کدهای اجرایی، دسته و میزان اطمینان را تعیین کرد. نمونه‌گیری ۱۴ درصدی با وزن‌دهی به کارهای پرمصرف انجام شد تا بازتاب‌دهنده واقعیت مصرف پردازش باشد. برای ارزیابی عامل‌های پژوهشی، رونوشت نشست‌ها بررسی شد. در صورت محرمانه بودن یا عدم دسترسی به داده‌ها، مورد به شکل محافظه‌کارانه به عنوان توسعه عمومی منظور گردید.

شما در حال انجام یک ممیزی داخلی در شرکت آنتروپیک هستید تا مقصد توان پردازشی را تفکیک کنید. هدف، ارائه گزارشی عمومی از نحوه مصرف تراشه‌های شتاب‌دهنده در چند بخش مشخص است. یکی از مهم‌ترین اهداف، تفکیک پردازش صرف‌شده برای تحقیقات ایمنی از سایر بخش‌های تحقیق و توسعه است...

[...]

پژوهش ایمنی فعالیتی است که هدف اصلی آن امن‌تر، مفهوم‌تر یا مطمئن‌تر ساختن سامانه‌ها باشد...

[...]

از سوی دیگر، موارد زیر خارج از دامنه پژوهش‌های ایمنی قرار می‌گیرند...

[...]

نقاط قوت و محدودیت‌ها: دسته‌بندی کارها اگرچه چالش‌برانگیز است، اما با تعاریف دقیق و روشن امکان‌پذیر خواهد بود؛ برای مثال پژوهش در حوزه نظارت مقیاس‌پذیر هم‌زمان موجب هم‌راستایی بهتر و کارایی تجاری بیشتر می‌شود. تعریف مبسوط وظایف، همگرایی میان مدل و بازبین‌های انسانی را تا حد یک تا دو درصد اختلاف ممکن ساخت، گرچه موارد مرزی همچنان نیازمند بازبینی طولانی‌مدت بودند.

محدودیت‌ها شامل سه مورد است: اتکای برخی برچسب‌ها به قواعد خودکار و عدم راستی‌آزمایی صددرصدی آن‌ها؛ بازه زمانی یک‌هفته‌ای که اگرچه امکان‌پذیری سنجش را ثابت می‌کند اما برای تحلیل روند کافی نیست؛ و در نهایت اینکه سنجش سهم پردازش صرفاً نشان‌دهنده میزان هزینه است، به این معنی که افزایش بازدهی یک رده‌بندی‌کننده ممکن است سهم محاسباتی ایمنی را کمتر نشان دهد، بدون آنکه از حجم واقعی کار ایمنی کاسته شده باشد.

مارینا فاوارو و فیلی رایت نگارش این مقاله را با همکاری تحریریه سانتی رویز، آدام فارینا و سارا پولاک بر عهده داشتند. جک کلارک مدیریت پژوهش را عهده‌دار بود و دن آلتمن، کری پرسن، ای‌جی کورابی، جیمز بردبری، هولدن کارنوفسکی، کوین تروی و آویتال بالویت بازخورد ارائه دادند. اثبات فنی مفاهیم توسط جون شرن چان، برایان کالورت، فرانچسکو موسکونی، هنری دو ولانس، فابین راجر و جو بنتون انجام شد. طراحی‌های بصری اثر شان کارتر، جانی گومز، ماریا گونزالس، فیاض اشرف، مونیکا توچوفسکا و کیم ویتی است. الکس کلود و آندریا والونه کارگاه تیم قرمز این شاخص‌ها را با حضور کارشناسان خارجی برگزار کردند.

با سپاس از نیت راش، الی لیفلند و پیتر ویلدفورد برای بازخوردهای ارزشمندشان.

پی‌نوشت‌ها

  1. برای درک ملموس سطوح خودکارسازی، سناریوی رفع نقص در خط انتقال داده شبانه را در نظر بگیرید:
    • در سطح AL3 («همکاری»)، مهندس گزارش خطا را در اختیار کلود می‌گذارد و با راهنمایی وی فرایند اصلاح را پیش می‌برد و در صورت بروز چالش تصمیم‌گیری با انسان است.
    • در سطح AL4 («هدایت»)، مهندس صرفاً هشدار خطا را به کلود ارجاع می‌دهد؛ کلود به‌طور مستقل خطا را یافته، اصلاح را آزمایش و مستندسازی می‌کند و در پایان گزارش را برای تایید و اعمال به مهندس تحویل می‌دهد.
    • در سطح AL5 («کاملاً خودمختار»)، سیستم بدون نیاز به مداخله انسانی، خرابی را کشف، رفع و در محیط عملیاتی مستقر می‌سازد.
  2. توان پردازشی به‌صورت یک منبع یکپارچه و پویا مدیریت می‌شود؛ از این رو ارقام ارائه‌شده مربوط به یک هفته مشخص بوده و بازتاب‌دهنده تخصیص ثابت بودجه‌های مالی نیست.
اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: anthropic.com