اشتراک
مالی فناوری آموزش

پرسش و پاسخ FTAV: سریکانت جاگاباتولا

یک استاد دانشگاه نیویورک در مورد اینکه چگونه هوش مصنوعی اکنون به راحتی از پس آزمون‌های سطح یک CFA برمی‌آید و اینکه این موضوع چه معنایی برای شغل شما دارد، صحبت می‌کند

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

سریکانت جاگاباتولا، استاد مدرسه کسب‌وکار استرن دانشگاه نیویورک، در پژوهشی پیشگامانه نشان داده است که مدل‌های زبانی بزرگ (LLM) برای نخستین بار قادر به قبولی در آزمون دشوار سطح سوم CFA هستند. این مطالعه که با همکاری پلتفرم «گودفین» انجام شده، بر استفاده از مدل‌های زبانی به عنوان «قاضی» و بهره‌گیری از تکنیک «زنجیره تفکر» برای دستیابی به استدلال‌های دقیق تمرکز داشته است. نتایج حاکی از آن است که مدل‌های پیشرفته در پاسخ‌دهی به پرسش‌های تشریحی عملکرد بسیار قوی‌تری نسبت به مدل‌های ساده‌تر دارند؛ هرچند برخلاف تصور رایج، این مدل‌ها در نمره‌دهی سخت‌گیرتر از مصححان انسانی عمل کرده‌اند. جاگاباتولا در مورد خطر نشت داده‌ها و احتمال آموزش مدل‌ها با سوالات آزمون، محتاط است، اما بر این باور است که چنین فناوری‌هایی در حال حاضر بیشتر نقش «مکمل» برای توانمندسازی نیروی انسانی را ایفا می‌کنند تا جایگزینی برای آن. با وجود توانمندی‌های شگفت‌انگیز هوش مصنوعی، وی همچنان نسبت به مسئولیت‌پذیری انسانی و ابهاماتی که در آینده مشاغل، به‌ویژه در سطوح ابتدایی، ایجاد می‌شود، هشدار می‌دهد. در نهایت، دانشجویان و متخصصان نسبت به این تحولات احساسی دوگانه دارند؛ از یک‌سو از افزایش توانمندی‌های فردی استقبال می‌کنند و از سوی دیگر، اضطرابی ناشی از عدم قطعیت‌های شغلی در عصر هوش مصنوعی را تجربه می‌کنند. این تحقیق نشان می‌دهد که اگرچه مرزهای میان مدل‌های هوش مصنوعی در وظایف ساده در حال کمرنگ شدن است، اما در وظایف پیچیده و استدلالی، مدل‌های بزرگ‌تر همچنان برتری خود را حفظ کرده‌اند.

سریکانت جاگاباتولا، استاد مدرسه کسب‌وکار استرن دانشگاه نیویورک، نویسنده همکار مقاله‌ای با عنوان «استدلال مالی پیشرفته در مقیاس: ارزیابی جامع مدل‌های زبانی بزرگ در آزمون سطح سوم CFA» است که به گفته خودش اولین مقاله‌ای است که نشان می‌دهد مدل‌های هوش مصنوعی همه‌منظوره می‌توانند سخت‌ترین آزمون صنعت مالی را پشت سر بگذارند.

این مطالعه و وب‌سایتی که یافته‌های آن را نشان می‌دهد با همکاری گودفین، یک پلتفرم مدیریت ثروت با کمک هوش مصنوعی، تولید شده است.

سریکانت، می‌توانید فرضیه‌ای را که می‌خواستید آزمایش کنید برایم توضیح دهید؟

مدل‌های زبانی بزرگ توانایی‌های فوق‌العاده‌ای در طیف وسیعی از حوزه‌ها نشان داده‌اند و توانایی‌های آن‌ها در چند سال گذشته به شکل چشمگیری بهبود یافته است. بنابراین ما با تفکر در مورد توانایی‌های مدل‌های زبانی بزرگ در حوزه‌های تخصصی و پرریسک شروع کردیم. مالی، مانند هر حوزه تخصصی دیگری، مفاهیم زیادی دارد که مختص به این موضوع هستند — اصطلاحات خاصی که بسیار ویژه این حوزه هستند.

بنابراین وقتی ما یک مدل زبانی بزرگ را که بر روی طیف گسترده‌ای از منابع داده آموزش دیده است در نظر می‌گیریم، این سوال مطرح می‌شود که آیا می‌توانیم بگوییم این مدل‌ها توانایی کار کردن به‌صورت آماده و بدون تنظیمات خاص را دارند. این سوال کلیدی بود که می‌خواستیم به آن پاسخ دهیم. این یک فرصت ارزشمند برای ایجاد یک معیار سنجش، ارزیابی مدل‌های زبانی بزرگ و درک میزان پیشرفت توانایی‌های آن‌ها بود.

یک معیار سنجش خوب باید ویژگی‌ها یا کیفیت‌های خاصی داشته باشد. باید نمایانگر مجموعه مهارت‌های مورد نیاز در آن حوزه خاص باشد. باید توسط افراد جامعه به‌عنوان معیار سنجش درست شناخته شود. بنابراین اگر عملکرد خوبی در معیار سنجش نشان دهید، مردم باید باور کنند که این عملکرد واقعاً به عملکرد در دنیای واقعی تبدیل می‌شود. برای مشاوره مالی، آزمون CFA استاندارد طلایی است.

و به طور خلاصه، چه یافته‌ای داشتید؟

یافته کلیدی ما این است که مدل‌های زبانی بزرگ پیشرفته و در خط مقدم می‌توانند نمره قبولی در آزمون آزمایشی سطح سوم CFA را کسب کنند. و این اولین بار است که، تا جایی که ما می‌دانیم، این موضوع گزارش می‌شود. تحقیقات قبلی — که شاید دو سال پیش انجام شده بود — نشان داد که مدل‌های زبانی بزرگ پیشرفته در آن مقطع زمانی می‌توانستند سطوح یک و دو CFA را پشت سر بگذارند، اما در سطح سه شکست خوردند. چیزی که ما اکنون می‌یابیم این است که توانایی‌های آن‌ها به‌طور چشمگیری افزایش یافته است.

آیا این موضوع فقط به این بود که سوالات خام را وارد کنید و از مدل‌ها بخواهید پاسخ تولید کنند، یا رویکردی دقیق‌تر از آن بود؟

بله، در اینجا نکات ظریفی وجود دارد. دو نوع سوال در این آزمون وجود دارد: سوالات چندگزینه‌ای و سوالات تشریحی. برای سوالات چندگزینه‌ای، ما سوالات آزمون آزمایشی را وارد می‌کنیم و از مدل زبانی بزرگ می‌خواهیم یکی از گزینه‌ها را انتخاب کند. ارزیابی این کار نسبتاً ساده است زیرا ما کلید پاسخ را نیز داریم.

اما سوالات تشریحی نیز وجود دارند که در آن‌ها یک سناریو و چند سوال بر اساس اطلاعات ارائه شده مطرح می‌شود. این پاسخ باید به‌درستی ارزیابی شود. این کار ساده‌ای نیست که بررسی کنیم آیا پاسخ دقیقاً کلمه به کلمه با کلید پاسخ مطابقت دارد یا نه.

این چالشی است که در سایر مطالعات معیار سنجش نیز وجود دارد، و یکی از رویکردهایی که ظهور کرده است، چیزی است که به آن «مدل زبانی به‌عنوان قاضی» می‌گویند. کاری که ما معمولاً انجام می‌دهیم این است که یک مدل بسیار قدرتمند را در نظر می‌گیریم و مقاله تولید شده را به همراه پاسخ واقعی و تمام زمینه‌های مرتبط به آن می‌دهیم. سپس از مدل می‌خواهیم مقاله را طوری نمره‌دهی کند که گویی یک مصحح است.

این کاری است که اکثر مردم انجام می‌دهند، اما ما به همین جا بسنده نکردیم. ممکن است سوگیری‌های ریشه‌داری در نمره‌دهی وجود داشته باشد، بنابراین ما همچنین فرآیند استخدام مصححان دارای گواهینامه سطح سوم CFA را طی کردیم و از آن‌ها خواستیم همه پاسخ‌ها را نیز نمره‌دهی کنند. سپس نمره کلی را با استفاده از هر دو رویکرد محاسبه کردیم.

آیا مدل‌های زبانی بزرگ معمولاً نمره بالاتر یا پایین‌تری نسبت به انسان‌ها می‌دادند؟

ما دریافتیم که در سوالات یکسان، نمره‌دهنده مدل زبانی بزرگ در مجموع سخت‌گیرتر بود. به طور متوسط، آن‌ها امتیازات کمتری نسبت به انسان‌ها اختصاص می‌دادند.

این برخلاف چیزی است که بسیاری از ما هنگام استفاده از مدل‌های زبانی بزرگ تجربه کرده‌ایم، که اغلب به نظر می‌رسد کاربر را چاپلوسی می‌کنند و بدون توجه به هر چیزی بازخورد مثبت می‌دهند. آیا این نتیجه برای شما تعجب‌آور بود؟

تعجب‌آور بود. چیزی که شما اشاره کردید در برخی از ادبیات موجود نیز مشاهده شده است. اما این چیزی نیست که ما پیدا کردیم.

نکته ظریف دیگر این است که برای مدل‌های زبانی بزرگ، نحوه راهنمایی (پرامپت) دادن به آن‌ها به‌طور قابل توجهی کیفیت پاسخی را که دریافت می‌کنید تعیین می‌کند. بنابراین ما انواع مختلف تکنیک‌های راهنمایی را ارزیابی می‌کنیم و دریافتیم که تکنیک راهنمایی زنجیره تفکر بهترین عملکرد را دارد.

آیا می‌توانید به زبان ساده توضیح دهید که راهنمایی زنجیره تفکر چیست؟

البته. در راهنمایی معمولی، شما معمولاً سوال را مطرح می‌کنید، هر زمینه‌ای که لازم است را به مدل زبانی بزرگ می‌دهید و پاسخ می‌خواهید. در راهنمایی زنجیره تفکر، شما از مدل زبانی بزرگ می‌خواهید که قبل از ارائه پاسخ، استدلال خود را توضیح دهد و تفکر خود را نشان دهد.

در ادبیات مشخص شده است که از مدل زبانی بزرگ خواستن برای نشان دادن کار و استدلال خود در نهایت عملکرد را بهبود می‌بخشد و پاسخ بهتری می‌دهد.

با نگاهی به نتایج، به نظر می‌رسد همه مدل‌هایی که آزمایش کردید عملکرد نسبتاً خوبی داشتند. آیا این نشان‌دهنده درجه‌ای از کالایی‌شدن (commoditisation) است؟

© Shetty, P et al, 2025

یکی از یافته‌های کلیدی ما این است که در سوالات چندگزینه‌ای، درجه بیشتری از هم‌خوشه‌شدن را در بین مدل‌ها مشاهده می‌کنیم. اما در سوالات تشریحی، تفاوت بسیار بیشتری بین مدل‌ها وجود دارد، به طوری که مدل‌های استدلالی عملکرد بسیار بهتری نسبت به نسخه‌های غیراستدلالی دارند و مدل‌های پیشرفته عملکرد بسیار بهتری نسبت به مدل‌های متن‌باز دارند.

شواهد ما از این ادعا حمایت می‌کند که عملکرد برای برخی وظایف در حال همگرایی است، اما برای وظایف دشوارتر، مدل‌های بزرگ‌تر همچنان به نظر می‌رسد خود را از جمع متمایز می‌کنند.

آیا راهی برای دانستن یا حداقل تشخیص اینکه آیا یک مدل زبانی بزرگ خاص بر روی آن مجموعه خاص از سوالات آزمایشی آموزش دیده است وجود دارد؟

سوال عالی. یکی از دلایلی که ما آزمون‌های CFA را انتخاب کردیم، اجتناب از چیزی است که نشت داده (data leakage) نامیده می‌شود، به این معنی که وظیفه آزمون قبلاً توسط مدل در فرآیند آموزش مشاهده شده باشد. هرگز نمی‌توان به طور قطعی آن را رد کرد. اما به دلیل اینکه بسیاری از این سوالات معمولاً پشت دیوار پرداخت هستند، مدل‌های زبانی بزرگ ممکن است آن‌ها را در طول فرآیند آموزش ندیده باشند.

بسیاری از تحقیقات قبلی شما در مورد خرده‌فروشی و زنجیره تامین است و شما به عنوان یک فرد بیرونی به حوزه مالی می‌آیید. آیا فکر می‌کنید نقش‌های خدمات مالی به ویژه در برابر اتوماسیون هوشمند آسیب‌پذیر هستند؟

من این مدل‌ها را مکمل استعدادهای موجود می‌بینم. ما یک مطالعه در مقیاس بسیار کوچکتر در مورد اینکه چگونه یک مدل زبانی بزرگ با انسان‌ها در ارائه مشاوره مالی تعامل می‌کند انجام دادیم. من می‌خواهم در تعمیم بیش از حد از آن محتاط باشم، اما معمولاً چیزی که پیدا کردیم این بود که مدل‌های زبانی بزرگ در ارائه پاسخ‌های دقیق بسیار خوب بودند، اما همچنین زمینه‌های زیادی را که به صراحت به آن‌ها گفته نشده بود از دست می‌دادند، و مشکلاتی از نظر اعتماد کاربر نهایی و نحوه درک آن‌ها از این مدل‌های زبانی بزرگ وجود داشت.

بنابراین همانطور که در حال حاضر هستند، مشخص نیست. ما در این مرحله شواهدی نداریم که به طور قطعی بگوییم چه چیزی را می‌توانند خودکار کنند، اما شواهد زیادی وجود دارد که نشان می‌دهد آن‌ها می‌توانند به طور قابل توجهی نیروی کار موجود را تکمیل کنند.

یک نگرانی بزرگ، فکر می‌کنم، فقط کیفیت خروجی نیست. این است که تولید مشاوره توسط مدل زبانی بزرگ، شرکت را از مسئولیت انسانی مبرا می‌کند.

بنابراین، من مدیر آکادمیک یک برنامه کارشناسی در اینجا در مدرسه استرن نیویورک هستم، و در آن نقش واقعاً به این فکر می‌کنم که هوش مصنوعی چه تأثیری بر استخدام آینده، به ویژه مشاغل سطح ابتدایی، خواهد داشت، زیرا این چیزی است که ما دانشجویان کارشناسی خود را برای آن آماده می‌کنیم. چیزی که می‌توانم بگویم این است که هنوز به نظر می‌رسد درجه بالایی از عدم قطعیت در مورد اینکه اوضاع به کدام سمت خواهد رفت وجود دارد.

آیا دانشجویان شما در مورد جایی که هوش مصنوعی جامعه را می‌برد خوش‌بین هستند یا بدبین؟

اگر بتوانم تعمیم دهم، چیزی که می‌بینم کمی ترکیبی است. قطعاً درجه‌ای از خوش‌بینی وجود دارد زیرا استفاده از این فناوری‌ها می‌تواند بسیار توانمندکننده باشد. و آن‌ها ناگهان احساس می‌کنند که می‌توانند کارهایی انجام دهند که قبلاً احتمالاً نمی‌توانستند. برای مثال، کدنویسی وایب (vibe coding)، این چیزی است که واقعاً توانمندکننده است. و بیشتر از بدبینی، می‌گویم کمی اضطراب وجود دارد که عمدتاً ناشی از عدم قطعیت در مورد اینکه اوضاع در آینده چگونه ممکن است به نظر برسد، است.

آیا به دانشجویان خود اجازه می‌دهید از ChatGPT برای نوشتن تکالیفشان استفاده کنند؟

به عنوان یک دانشگاه، در این مقطع، هیچ سیاستی برای جلوگیری از استفاده آن‌ها از هرگونه ابزار هوش مصنوعی وجود ندارد. تک تک اعضای هیئت علمی رویکردهای متفاوتی دارند.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: ft.com