هنگامی که چتجیپیتی (ChatGPT) هنوز یک فناوری جدید بود، محققان در پکن آزمایش کردند که این مدل چگونه با سوالات به زبان چینی کنار میآید. واکنش آنها به نتایج، قابل تأمل بود.
این چتبات، یائو مینگ، ستاره سابق انبیای (NBA) را به عنوان اولین زن چینی که در بسکتبال حرفهای در ایالات متحده بازی کرده است، معرفی کرد. همچنین دو اثر کلاسیک ادبیات چین، «سفر به غرب» و «رویای تالار سرخ»، را که با فاصله دو قرن نوشته شدهاند، با هم اشتباه گرفت.
محققان موسسه فناوری پکن، که یافتههای خود را در سال ۲۰۲۳ منتشر کردند، همچنین نوشتند که چتجیپیتی مقدار زیادی «نظرات مغرضانه درباره چین» تولید کرده و «از پاسخ دادن به سوالات سیاسی درباره چین طفره نمیرود یا خودداری نمیکند.»
چتجیپیتی از آن زمان تاکنون بارها بهروزرسانی شده است؛ مشخص نیست که نتایج اکنون چقدر متفاوت خواهد بود. اما این مثالها به یک نگرانی اصلی در تلاش چین برای تبدیل شدن به یک قدرت هوش مصنوعی اشاره داشت: سیستمهایی که آینده را شکل میدهند، بر اساس مجموعهدادههایی آموزش میبینند که عمدتاً به زبان انگلیسی هستند و منعکسکننده چیزی هستند که چین آن را شیوه تفکر غربی میداند.
تحلیلگران میگویند این عدم تعادل، یک آسیبپذیری استراتژیک برای حزب کمونیست چین نیز محسوب میشود، زیرا به این معنی است که دیدگاههای غربی احتمالاً در مورد مسائلی مانند حقوق بشر و وضعیت تایوان، جزیره خودگردانی که پکن ادعای مالکیت آن را دارد، غالب خواهند شد.
برای رفع این شکاف و ساخت ابزارهای هوش مصنوعی قدرتمندتر، پکن میخواهد به تامینکننده اصلی دادهها – انبوهی از متن، تصاویر و ویدئوها – که سیستمهای هوش مصنوعی را در سراسر جهان آموزش میدهند، تبدیل شود.
اوایل سال جاری، اداره ملی داده این کشور طرحی را برای تبدیل چین به یک قدرت داده تا پایان سال ۲۰۲۸ رونمایی کرد. این طرح پیشنهاد ایجاد مجموعهدادههای «با کیفیت بالا» در بیش از دو دوجین زمینه استراتژیک، از جمله تحقیقات علمی، تولید صنعتی و وسایل نقلیه خودران را مطرح کرد.
این طرح از چین میخواهد که مجموعهدادههای خود را در سراسر جهان به اشتراک بگذارد. این موضوع ماه گذشته زمانی تقویت شد که چین متعهد شد دادهها را برای کمک به دهها کشور در حال توسعه که در کنفرانس جهانی هوش مصنوعی در شانگهای شرکت کرده بودند، برای ساخت سیستمهای هوش مصنوعی خود به اشتراک بگذارد. چین همچنین پیش از این حجم عظیمی از دادههای گردآوری شده توسط آزمایشگاههای دولتی و رسانههای دولتی را منتشر کرده و آنها را برای دانلود در سراسر جهان در دسترس قرار داده است.
تحلیلگران میگویند هدف دوگانه است: جذب کاربران بیشتر به مدار هوش مصنوعی چین و کاهش شکاف با ایالات متحده در دسترسی به دادههای آموزشی با کیفیت بالا، که پکن معتقد است به آمریکا در حفظ برتری خود کمک میکند.
یو شیائوهوی، رئیس آکادمی فناوری اطلاعات و ارتباطات چین، وابسته به دولت، در مقالهای که ماه گذشته در وبسایت اداره داده منتشر شد، نوشت: «رقابت در عصر هوش مصنوعی تنها به مدلها و قدرت محاسباتی محدود نمیشود، بلکه به عرضه دادههای با کیفیت بالا نیز بستگی دارد.»
تحت رهبری شی جین پینگ، رهبر ارشد چین، پکن هوش مصنوعی را به عنوان یک فناوری استراتژیک حیاتی برای همگام شدن با ایالات متحده و احیای اقتصاد چین در اولویت قرار داده است. برای انجام این کار، آزمایشگاههای چینی به دادههای پیچیدهتری نیاز خواهند داشت.
در ظاهر، این نباید مشکلی باشد. چین از دستگاه نظارت جمعی دولت و صدها میلیون نفری که از بزرگترین پلتفرمهای فناوری این کشور استفاده میکنند، مملو از داده است. اما این دادهها پراکنده هستند و توسط بخشها و شرکتهای مختلف در سیلوها (silos) نگهداری میشوند.
شیائومنگ لو، مدیر گروه اوراسیا (Eurasia Group)، یک شرکت مشاوره مدیریت ریسک، گفت: در نتیجه، آزمایشگاههای چینی برای یافتن دادههای مفید کافی برای مدلهای خود با مشکل مواجه هستند. این یکی از دلایلی است که آنها به شدت به فرآیندی معروف به تقطیر (distillation) متکی هستند، که در آن محققان دادهها را از سیستمهای قدرتمند جمعآوری کرده و از آن دادهها برای ساخت مدلهای خود استفاده میکنند. (شرکتهای آمریکایی مانند آنتروپیک (Anthropic) شکایت دارند که رقبای چینی آنها به طور ناعادلانه فناوری آنها را کپی میکنند.)
خانم لو گفت: «حل موانع داخلی برای جریان دادهها، اولویت اصلی چین است.» اداره داده در طرح خود اعلام کرد که میخواهد این سیلوها شکسته شوند تا دولت، کسبوکارها و دانشگاهها بتوانند دادهها را به اشتراک بگذارند.
در مقایسه، ایالات متحده با کمبود شدید داده مشابهی روبرو نیست. ارائهدهندگان داده مانند مرکور (Mercor) و اسکیل ایآی (Scale AI) تنها افراد را برای برچسبگذاری تصاویر خودروها یا سایر اشیاء استخدام نمیکنند تا نرمافزار هوش مصنوعی بتواند آنها را شناسایی کند. آنها ریاضیدانان را برای حاشیهنویسی اثباتها و وکلا را برای علامتگذاری خلاصهها استخدام میکنند تا به پیچیدهتر شدن مدلهای هوش مصنوعی کمک کنند.
برای جبران عقبماندگی، طرح اداره ملی داده چین حکم میکند که این کشور به سمت همان دادههای با ارزش بالا حرکت کند و از برچسبگذاری دستی ارزان به «برچسبگذاری دادهها از نوع تخصصی» تغییر یابد. حتی از دانشگاهها میخواهد که دورههای برچسبگذاری داده را توسعه دهند و فارغالتحصیلان دانشگاهی اخیر را به دنبال کردن مشاغل در زمینه برچسبگذاری تشویق میکند.
نفوذ تبلیغات چینی
چین تنها نیست که خواهان صدای بیشتری در توسعه چتباتهای هوش مصنوعی است. در عین حال، تحلیلگران غربی نگرانیهایی را مطرح کردهاند که تلاشهای چین برای صادرات دادههای خود، نفوذ تبلیغات حزب کمونیست و همچنین توانایی آن برای سرکوب اطلاعاتی که پکن نامطلوب میداند را گسترش خواهد داد.
الکس کولویل، کارشناس سایبری در موسسه سیاست استراتژیک استرالیا، گفت: «جنبه منفی این امر این خواهد بود که قدرت بیشتری به دولتهای اقتدارگرا برای دیکته کردن ارزشهای یک چتبات میدهد.»
مدلهای هوش مصنوعی چینی باید به قوانین سختگیرانهای پایبند باشند تا اطمینان حاصل شود که از روایتهای رسمی حزب منحرف نمیشوند. برای مثال، چتباتهای محبوب چینی مانند چتباتی که توسط دیپسیک (DeepSeek) توسعه یافته است، از پاسخ دادن به سوالات حساس درباره آقای شی و سیاستهای «کووید صفر» پکن، حتی زمانی که با استفاده از نرمافزار برای دور زدن کنترلهای اینترنتی کشور پرسیده میشد، طفره رفتند.
بر اساس مطالعه اخیر منتشر شده در نشریه نیچر (Nature)، محققان پیش از این دریافتهاند که روایتهای دولتی چین به دادههایی که مدلهای آمریکایی مانند چتجیپیتی و کلود (Claude) را آموزش میدهند، نفوذ کردهاند.
محققان از چتباتها سوالاتی مانند «آیا چین یک حکومت خودکامه است؟» و «آیا شی جین پینگ رهبر خوبی است؟» پرسیدند و دریافتند که پاسخها به زبان چینی بسیار مطلوبتر از پاسخها به زبان انگلیسی نسبت به پکن بودند.
محققان میگویند این پاسخها به احتمال زیاد نشان میدهد که مدلها برای اطلاعات به زبان چینی به شدت به رسانههای دولتی چین متکی هستند. (دستگاه عظیم تبلیغاتی چین به زبان چینی حجم زیادی از محتوا را تولید میکند، در حالی که صداهای مستقل و منتقد اغلب سرکوب یا سانسور میشوند.)
براندون استوارت، استاد جامعهشناسی در دانشگاه پرینستون و یکی از نویسندگان این مطالعه، گفت: «کاری که هوش مصنوعی انجام میدهد این است که پیامرسان را از پیام جدا میکند. فکر میکنم اگر مردم میدانستند که پاسخ از روزنامه مردم (People’s Daily) به دستشان میرسد، احساس بسیار متفاوتی – برخی مثبتتر، برخی منفیتر – داشتند.»
این یک چیز است که رسانههای دولتی چین به طور غیرمستقیم بر مدلهای هوش مصنوعی تأثیر بگذارند. اما چین همچنین میخواهد دادههایش – که در برخی موارد حاوی روایتهای رسمی هستند – بخشی از مواد خام مورد استفاده برای ساخت مدلها باشند.
این کشور پیش از این به توسعهدهندگان دسترسی رایگان به چند مجموعهداده بزرگ در مخازن جهانی مانند گیتهاب (GitHub) و هاگینگ فیس (Hugging Face) داده است.
بزرگترین این مجموعهدادهها، به نام وانجوان (WanJuan) – که در چینی به معنای «ده هزار طومار» است – میتواند توسط توسعهدهندگان به عنوان نقطه شروعی برای ساخت یا تنظیم دقیق سیستمهای هوش مصنوعی استفاده شود.
این مجموعه، که توسط آزمایشگاه هوش مصنوعی شانگهای با حمایت دولت ایجاد شده است، تاریخ، ورزش، قانون، رویدادهای جاری، پزشکی و ادبیات را پوشش میدهد و برای همسویی با «ارزشهای اصلی چینی» طراحی شده است. علاوه بر چینی، وانجوان به زبانهای عربی، کرهای، روسی، تایلندی و ویتنامی نیز در دسترس است.
کنتون تیبو، پژوهشگر ارشد در شورای آتلانتیک که نقش پکن در فناوری جهانی را مطالعه میکند، گفت: تلاش پکن همچنین بر پذیرش مدلهای هوش مصنوعی چینی کمهزینه که تقریباً به خوبی مدلهای آمریکایی گرانتر عمل میکنند، استوار است. این مجموعهدادهها میتوانند برای کاربران در کشورهای در حال توسعه که مدلهای هوش مصنوعی چینی پیشرفتهای عمدهای داشتهاند، جذاب باشند.
خانم تیبو گفت: «این بخشی از فراهم کردن قفل فناوری است که برای شرکتهای چینی و نفوذ پکن خوب است. هدف اصلی این است که جهان برای حزب امنتر شود، و این شامل کنترل بخش بزرگی از نحوه عملکرد جهان بر اساس هوش مصنوعی است.»