اشتراک
هوش مصنوعی پژوهش علمی

عوامل هوش مصنوعی ادبیات علمی را بررسی می‌کنند — و خطاهای دهه‌ها پیش را کشف می‌کنند

عوامل هوش مصنوعی ادبیات علمی را بررسی می‌کنند — و خطاهای دهه‌ها پیش را کشف می‌کنند

در یک نگاه چکیدهٔ خودکار موتور هوش مصنوعی افق آبی

امروزه هوش مصنوعی به ابزاری قدرتمند برای ممیزی دانش علمی و شناسایی خطاهای دیرینه در متون و پایگاه‌های داده تبدیل شده است. محققان با استفاده از این فناوری، موفق به کشف اشتباهات تایپی و داده‌های نادرست در منابعی شده‌اند که دهه‌ها به عنوان مرجع علمی مورد استناد قرار می‌گرفتند. فراتر از تصحیح کتب قدیمی، هوش مصنوعی اکنون برای بررسی مقالات کنفرانس‌های معتبر نیز به کار می‌رود تا ادعاهای پژوهشی را با بازتولید آزمایش‌ها ارزیابی کند. با وجود این پیشرفت‌ها، دانشمندان هشدار می‌دهند که هوش مصنوعی هنوز «خطاپذیر» است و می‌تواند نتایج مثبت کاذب تولید کند یا در تفسیر پیچیدگی‌های علمی دچار لغزش شود. بر این اساس، رویکرد غالب میان پژوهشگران این است که هوش مصنوعی باید به عنوان یک «چشم دوم» برای شناسایی خطاهای احتمالی و جلب توجه انسان به نقاط مشکوک عمل کند، نه به عنوان داوری مستقل برای تصمیم‌گیری نهایی؛ چرا که همچنان نظارت و تأیید انسانی برای حفظ اعتبار و صحت بنیادهای علمی امری ضروری و حیاتی است.

برای دهه‌ها، شیمیدانان برای شناسایی مواد و برنامه‌ریزی فرآیندهایی مانند تقطیر به مقادیر نقطه جوش مندرج در کتاب‌های مرجع تکیه کرده‌اند. اما یک مدل هوش مصنوعی نشان داده است که برخی از اعداد قابل اعتماد در یک پایگاه داده مرجع از ابتدا اشتباه بوده‌اند.

سباستین پیوس، شیمیدان نظری در آزمایشگاه ژجیانگ در هانگژو، چین، در حال استفاده از یک سیستم هوش مصنوعی برای پیش‌بینی نقاط جوش چندین مولکول بود که این سیستم شروع به تولید مقادیری کرد که با ورودی‌های دیرینه‌پذیرفته‌شده در یک پایگاه داده مرجع ۷۵ ساله در تضاد بود. در ابتدا، او فکر کرد مدل اشتباه است. اما وقتی او به صورت دستی ادبیات اصلی را بررسی کرد، متوجه شد که داده‌های مرجع اشتباه هستند، نه مدل هوش مصنوعی.

در دو مورد دیگر، مدل هوش مصنوعی پیوس خطاهایی را در مقالات و کتاب‌های مرجع قدیمی‌تر شناسایی کرد — اشتباهاتی که به قانون علمی راه یافته‌اند. یکی یک اشتباه تایپی در یک مقاله بود؛ دیگری مقادیر نادرست اندازه‌گیری‌های نقطه جوش یک قرن پیش. به گفته پیوس، هر دو خطا احتمالاً باعث «مشکلات زیادی» برای محققانی شده است که از پایگاه داده استفاده می‌کنند.

پیوس یکی از تعداد فزاینده دانشمندانی است که از هوش مصنوعی به عنوان ابزاری برای ممیزی دانش علمی استفاده می‌کنند. علاوه بر بررسی پایگاه‌های داده، محققان از ابزارهای تخصصی هوش مصنوعی برای جستجوی خطا در مقالات منتشر شده در مجلات و کنفرانس‌ها استفاده می‌کنند.

در تحلیلی که در ۲۲ ژوئیه به صورت آنلاین منتشر شد، محققان SAI Labs، یک شرکت بازبینی پژوهشی انتفاعی در دلاور، از عوامل هوش مصنوعی برای ارزیابی ۱۶۸ مقاله انتخاب شده برای ارائه شفاهی در کنفرانس بین‌المللی یادگیری ماشین (ICML) ۲۰۲۶ استفاده کردند. عوامل هوش مصنوعی ادعاهای اصلی نویسندگان را استخراج کردند، منابع همراه را دانلود کردند، در صورت امکان آزمایش‌ها را دوباره اجرا کردند و نتایج را با نتایج گزارش شده توسط نویسندگان مقایسه کردند.

از ۹۲ مقاله‌ای که حداقل پنج ادعا برای ارزیابی داشتند، عوامل هوش مصنوعی توانستند بیش از دو مورد از پنج ادعا را تنها در ۳۴ مقاله بازتولید کنند. عوامل تنها در هشت مقاله بیش از ۸۰٪ از ادعاها را با موفقیت تکرار کردند.

اما به گفته اود اریک گاندرسن، دانشمند رایانه در دانشگاه علم و صنعت نروژ در تروندهایم، چنین ابزارهای بررسی واقعیت هوش مصنوعی همچنان داوران غیرقابل اعتمادی برای مجموعه علمی هستند. او می‌گوید این ابزارها «مانند انسان‌ها اشتباه می‌کنند»، به همین دلیل کیفیت بررسی‌کننده‌های واقعیت هوش مصنوعی باید با نظارت انسانی پردازش شود.

بررسی‌کننده واقعیت هوش مصنوعی

بسیاری از محققان در حال حاضر زمان خود را به یافتن خطا در مقالات اختصاص می‌دهند و از ابزارهایی برای بررسی جنبه‌های خاصی از مقالات استفاده می‌کنند. اما به گفته جیمز زو، دانشمند رایانه در دانشگاه استنفورد، کالیفرنیا، یکی از مزایای استفاده از هوش مصنوعی سرعتی است که می‌تواند پایگاه‌های داده و ادبیات علمی را در مقایسه با انسان اسکن کند. «بزرگترین تفاوت این است که بتوانیم این کار را در مقیاسی انجام دهیم که قبلاً ممکن نبود.»

در مطالعه‌ای که در سرور پیش‌چاپ arXiv منتشر شد، زو و همکارانش از یک «بررسی‌کننده هوش مصنوعی» برای اسکن مقالات منتشر شده در NeurIPS — یک کنفرانس معتبر سالانه تحقیقات هوش مصنوعی — برای یافتن خطا استفاده کردند. ابزار آن‌ها نشان داد که خطاها در مقالات از ۳.۸ در سال ۲۰۲۱ به ۵.۹ در سال ۲۰۲۵ افزایش یافته است — افزایشی ۵۵٪.

زو می‌گوید: «اینها مقالاتی هستند که منتشر شده‌اند، بنابراین به نوعی به عنوان دانش بنیادی برای نسل بعدی تحقیق در نظر گرفته می‌شوند.» او می‌افزاید: «اگر در این پایه‌ها اشتباهاتی وجود داشته باشد، این می‌تواند منتشر شود و تحقیقات بعدی را سست‌تر کند.»

این تحلیل بر خطاهای «عینی» مانند خطاهای موجود در فرمول‌ها، محاسبات و شکل‌ها متمرکز بود و اشتباهات ذهنی در مورد تفسیر داده و تازگی را حذف کرد. نویسنده همکار، فدریکو بیانکی، دانشمند یادگیری ماشین در Together AI، مستقر در سانفرانسیسکو، کالیفرنیا، می‌گوید این یک انتخاب طراحی بود. او می‌گوید: «هوش مصنوعی نباید همه کارها را انجام دهد و انتخاب‌های مربوط به تازگی و اهمیت را به انسان‌ها واگذار کند.»

ماشین‌های خستگی‌ناپذیر

برخی از محققان بررسی‌کننده‌های هوش مصنوعی در دسترس عموم را برای تشخیص خطا در مقالات قبل از ارسال به کنفرانس‌ها مفید می‌دانند. در نظرسنجی از ۷۳۳ محققی که مقالات خود را در ICML در سال ۲۰۲۶ ارائه کردند، ۳۵٪ گفتند که ابزار Paper Assistant گوگل خطاهایی را در کار آن‌ها کشف کرده است و ۳۱٪ گفتند که بازخورد آن‌ها را به انجام آزمایش‌های جدید ترغیب کرده است.

هونگ له، ریاضی‌دانی در دانشگاه ماساچوست امهرست که با چنین ابزارهایی آزمایش کرده است، می‌گوید این سیستم‌ها به عنوان یک جفت چشم دوم برای گرفتن لغزش‌های جزئی مفید هستند. اما او هشدار می‌دهد که نباید نتایج بررسی‌کننده‌های هوش مصنوعی را بدون تأیید دستی پذیرفت، زیرا این ابزارها می‌توانند یافته‌های دقیق را به اشتباه به عنوان خطا علامت‌گذاری کنند.

یک پیش‌چاپ منتشر شده در ماه مه اشاره کرد که حتی بهترین مدل هوش مصنوعی فقط تا یک‌پنجم خطاهای مقالات تحقیقاتی را که توسط داوران انسانی علامت‌گذاری شده بودند، پیدا کرد. این مدل همچنین نتایج مثبت کاذب تولید کرد.

له هشدار می‌دهد که بررسی‌های هوش مصنوعی می‌توانند مفروضات را نادیده بگیرند یا مشکلاتی را اختراع کنند که واقعاً وجود ندارند. او می‌گوید اگر این ادعاها مستقیماً به تصمیمات انتشار وارد شوند، یک مقاله صحیح می‌تواند اشتباه قضاوت شود.

گاندرسن می‌گوید در حال حاضر، به نظر می‌رسد تشخیص‌دهنده‌های خطای هوش مصنوعی برای جلب توجه انسان به مشکلات احتمالی مناسب‌تر هستند تا اینکه خودشان تصمیم بگیرند که یک مقاله اشتباه است.

برخی از ابتکارات در تلاش هستند تا مشخص کنند چنین سیستم‌هایی چقدر قابل اعتماد هستند. داوطلبان پروژه Black Spatula در حال آزمایش مدل‌ها و دستورات هوش مصنوعی در برابر مقالاتی با خطاهای شناخته شده هستند، قبل از اینکه از دانشمندان با تخصص مرتبط بخواهند نتایج را ارزیابی کنند. این پروژه هنوز در حال جمع‌آوری شواهد است.

اشتراک:
این گزارش ترجمه و بازنویسی خبری با موتور هوش مصنوعی افق آبی است و برای خوانندهٔ فارسی‌زبان بازتنظیم شده. منبع اصلی: nature.com