در میانه رقابت تنگاتنگ غولهای فناوری مانند گوگل، مایکروسافت و متا برای سلطه بر بازار هوش مصنوعی، بازیگران بزرگ چینی مانند بایدو (Baidu)، علیبابا (Alibaba) و مونشات (Moonshot) با ارائه مدلهای زبان بزرگ خود یعنی ، و به عنوان «متنباز» (Open Source)، خبرساز شدهاند.
این حرکت که تغییری بزرگ نسبت به سیاست قبلی آنها مبنی بر ارائه مدلهای انحصاری و محافظتشده است، در نگاه اول به عنوان نشانهای از پذیرش قدرت جامعه متنباز برای دموکراتیزه کردن توسعه هوش مصنوعی و افزایش نوآوری تلقی میشود. اما با نگاهی عمیقتر، متوجه میشویم که این گشادهدستی، یک سراب است.
توهم گشادهدستی: تفاوت کلیدی بین «متنباز» و «اپن ویت»
واقعیت این است که بسیاری از این شرکتهای چینی، با وجود استفاده از برچسب فریبنده «متنباز»، در عمل تنها وزنهای از پیش آموزشدیده مدلهای خود را به اشتراک میگذارند، رویکردی که به درستی «اپن ویت» (Open Weight) نامیده میشود. این یعنی شما میتوانید مدل را دانلود و استفاده کنید، اما به مهمترین بخش آن، یعنی دادههایی که مدل با آنها آموزش دیده است، هیچ دسترسی ندارید.
بدون دسترسی به دادههای آموزشی، بررسی، تحقیق و تکرار فرآیند برای ساخت یک فناوری بیطرف، اخلاقی و قابل اعتماد غیرممکن است. این شرکتها در واقع از جامعه جهانی توسعهدهندگان میخواهند که به مدلهایی ایمان بیاورند که نمیتوانند آنها را به درستی درک یا بازرسی کنند.
یک بازی استراتژیک برای تسخیر آینده
این استراتژی چین بیشباهت به نبرد تاریخی اندروید و iOS نیست. همانطور که اندروید با ارائه یک پلتفرم متنباز، توسعهدهندگان، دانشگاهیان و حتی رقبا را به همکاری دعوت کرد و در نهایت به سهم بازار غالبی دست یافت، شرکتهای چینی نیز امیدوارند با ارائه رایگان مدلهای خود، به زیرساخت اصلی اکوسیستم نوپای هوش مصنوعی تبدیل شوند.
بایدو با ارائه رایگان مجموعه مدلهای ، و دیگران با مدلهای ارزانقیمت یا قدرتمندی مانند که عملکردشان مدلهای بسته مانند را به چالش میکشد، به دنبال تشویق پذیرش گسترده و تثبیت جایگاه خود هستند. آنها میخواهند پیش از آنکه بازار به بلوغ برسد، به انتخاب اول توسعهدهندگان تبدیل شوند.
دادهها، حلقه گمشده در پازل هوش مصنوعی متنباز
یک سیستم هوش مصنوعی واقعی تنها از کد منبع تشکیل نشده، بلکه شامل هفت جزء کلیدی است: کد منبع، پارامترهای مدل، مجموعه دادهها، هایپرپارامترها، کد منبع آموزش، تولید اعداد تصادفی و فریمورکهای نرمافزاری. برای اینکه یک مدل به درستی کار کند و نتایج مطلوب را ارائه دهد، تمام این قطعات باید در هماهنگی کامل باشند.
دادهها قلب تپنده هر مدل هوش مصنوعی هستند و طبق آمار، حدود ۸۰ درصد از پروژههای هوش مصنوعی به دلیل مشکلات مربوط به دادهها شکست میخورند. دادههای نادرست، ناقص یا مغرضانه منجر به مدلهایی میشود که رفتار قابل پیشبینی یا مطلوبی ندارند و بدون دسترسی به این دادهها، تکرارپذیری که اساس روش علمی است، از بین میرود.
قدرت و خطر مدلهای مبهم: از تسلا تا اعتماد کورکورانه
تصادف مرگبار خودروی تسلا در حالت رانندگی خودکار (FSD) در سال ۲۰۲۳، بدترین سناریوی ممکن را به تصویر کشید. سیستم نیمهخودکار خودرو به دلیل تابش مستقیم نور خورشید، نتوانست آنچه را دوربینهایش میدیدند (یا نمیدیدند) به درستی درک کند و واکنش مناسبی نشان دهد.
این فاجعه نتیجه مستقیم دادههای بصری ناقص و عدم وجود یک مکانیزم ایمنی برای پوشش چنین نقاط کوری بود. وقتی توسعهدهندگان هیچ دیدی به دادههای مدل نداشته باشند، نمیتوانند چنین اشتباهاتی را کشف کرده و برای بهبود عملکرد سیستم تلاش کنند. آنها مجبورند کورکورانه به جعبه سیاهی اعتماد کنند که میتواند عواقب مرگباری داشته باشد.
پیروزی شفافیت: چگونه جامعه متنباز هوش مصنوعی را امنتر میکند
در مقابل این رویکرد مبهم، قدرت شفافیت واقعی در جامعه متنباز خود را ثابت کرده است. برای مثال، مجموعه داده عظیم که برای آموزش مدلهای تولید تصویر از متن مانند Stable Diffusion استفاده میشد، به صورت کاملاً باز منتشر شد. این جامعه بود که با بررسی دقیق، بیش از هزار URL حاوی محتوای آزار جنسی کودکان را در آن کشف و زمینه را برای اصلاح آن فراهم کرد.
اگر این دادهها بسته بودند، ممکن بود مدلهای هوش مصنوعی شروع به تولید تصاویر غیرقانونی و مخرب کنند و فاجعهای برای کل صنعت رقم بخورد. شفافیت کامل به جامعه اجازه داد تا مشکل را شناسایی و حل کند و امنیت کاربران و صنعت را تضمین نماید.
انتخاب مسیر آینده: شفافیت رادیکال یا جعبههای سیاه؟
صنعت هوش مصنوعی در یک بزنگاه تاریخی قرار دارد. در حالی که این فناوری به سرعت در حال نفوذ به بخشهای حیاتی زندگی ما، از رانندگی خودروها گرفته تا تشخیصهای پزشکی است، ایجاد اعتماد از طریق ساخت سیستمهای بیطرف، قابل اتکا و ایمن هرگز تا این حد حیاتی نبوده است. تلاش شرکتهای چینی برای معرفی خود به عنوان قهرمانان نوآوری باز، تا زمانی که مهمترین جزء یعنی دادهها را پنهان میکنند، یک حرکت تبلیغاتی توخالی است.
راحتی استفاده از مدلهای «اپن ویت» مانند یا وسوسهانگیز است، اما به قیمت از دست دادن شفافیتی تمام میشود که برای نوآوری و ایجاد اعتماد ضروری است. جامعه هوش مصنوعی باید انتخاب کند: پذیرش شفافیت رادیکال از طریق متنباز واقعی، یا ساختن سیستمهای حیاتی فردا بر روی جعبههای سیاه امروز.

















