کتابهای قدیمی ؛ گنج جدید هوش مصنوعی
شرکتهای فعال در حوزه هوش مصنوعی برای توسعه مدلهای زبانی بزرگ، به حجم عظیمی از دادههای متنی یعنی کتابهای قدیمی نیاز دارند. اما در سالهای اخیر یک مشکل جدید به وجود آمده است؛ بخش قابل توجهی از محتوای موجود در اینترنت دیگر توسط انسانها نوشته نمیشود و با کمک ابزارهای هوش مصنوعی تولید شده است.
همین موضوع باعث شده برخی متخصصان نگران پدیدهای به نام «آلودگی دادهها» در فرآیند آموزش مدلهای هوش مصنوعی باشند. مدلهایی که با دادههای تولیدشده توسط ماشینها آموزش ببینند، ممکن است به مرور کیفیت خود را از دست بدهند و اطلاعات نادرست یا تکراری بیشتری تولید کنند.
در چنین شرایطی، یک منبع قدیمی دوباره مورد توجه قرار گرفته است: کتابهای قدیمی چاپی که سالها پیش از ظهور چتباتهای هوش مصنوعی منتشر شدهاند.
شرکت دادهپرداز ISBNdb معتقد است بهترین دادههای آموزشی برای هوش مصنوعی هنوز روی قفسه کتابخانهها قرار دارند؛ دادههایی انسانی، ویرایششده و قابل اعتماد که پیش از ورود هوش مصنوعی مولد به بازار نوشته شدهاند.
کتابهای چاپ شده قبل از دوران چتباتها؛ منبعی ارزشمند برای آموزش AI
شرکت ISBNdb که خود را یکی از بزرگترین پایگاههای اطلاعاتی کتاب در جهان معرفی میکند، اکنون تأمین کتابهای قدیمی فیزیکی برای آزمایشگاههای هوش مصنوعی را آغاز کرده است تا این کتابها به دادههای آموزشی مدلهای جدید تبدیل شوند.
این شرکت معتقد است کتابهای چاپشده قبل از سال ۲۰۲۲ ارزش ویژهای دارند؛ زیرا قبل از گسترش مدلهای زبانی بزرگ مانند ChatGPT منتشر شدهاند و احتمال وجود متنهای تولیدشده توسط هوش مصنوعی در آنها بسیار کم است.
برخلاف محتوای اینترنتی که هر روز با حجم زیادی از نوشتههای تولیدشده توسط ماشینها روبهرو است، کتابهای چاپی یک سند ثابت و انسانی محسوب میشوند. محتوای یک کتاب چاپشده را نمیتوان مانند یک صفحه اینترنتی بهصورت پنهانی تغییر داد یا با متنهای ماشینی ترکیب کرد.
به همین دلیل، شرکتهای هوش مصنوعی این کتابها را نوعی منبع داده معتبر میدانند که میتواند کیفیت آموزش مدلها را افزایش دهد.

مشکل بزرگ هوش مصنوعی؛ خطر آموزش با دادههای تولیدشده توسط خودش
یکی از نگرانیهای مهم در توسعه هوش مصنوعی، پدیدهای به نام «فروپاشی مدل» یا Model Collapse است. این اتفاق زمانی رخ میدهد که یک مدل هوش مصنوعی با دادههایی آموزش ببیند که خود مدلهای قبلی تولید کردهاند.
در این شرایط، هر نسل جدید از مدلها ممکن است بخشی از کیفیت و تنوع دادههای انسانی را از دست بدهد. در نهایت، سیستمهایی ایجاد میشوند که بیشتر از آنکه اطلاعات واقعی تولید کنند، بازتولیدکننده اشتباهات و محدودیتهای مدلهای قبلی هستند.
رشد سریع محتوای تولیدشده توسط هوش مصنوعی در اینترنت این نگرانی را افزایش داده است. امروزه حجم زیادی از مقالات، توضیحات محصول، پستهای شبکههای اجتماعی و متنهای عمومی با ابزارهای هوش مصنوعی نوشته میشوند.
به همین دلیل، برخی شرکتها به دنبال دادههایی هستند که پیش از ورود گسترده هوش مصنوعی تولید شده باشند؛ دادههایی که منشأ انسانی مشخصی دارند.
چالش اخلاقی و تصویری خرید و نابودی میلیونها کتاب
با وجود ارزش بالای این کتابهای قدیمی برای آموزش هوش مصنوعی، یک مسئله بحثبرانگیز وجود دارد: فرآیند استخراج اطلاعات از کتابهای فیزیکی.
برای اسکن سریع تعداد زیادی کتاب، معمولاً لازم است جلد و عطف کتاب جدا شود تا صفحات بتوانند با سرعت بالا وارد دستگاههای اسکن شوند. این روش باعث از بین رفتن نسخه فیزیکی کتاب میشود.
شرکت ISBNdb نیز به این موضوع اشاره کرده و برای مشتریان خود قراردادهای محرمانگی ارائه میدهد. نام شرکتهایی که این کتابها را خریداری میکنند، منتشر نمیشود.
دلیل این محرمانگی، نگرانی درباره واکنش عمومی است. تصور اینکه یک شرکت هوش مصنوعی میلیونها کتاب را خریداری کرده و سپس آنها را برای استخراج داده از بین ببرد، میتواند تصویر منفی برای افکار عمومی ایجاد کند.
برخی شرکتها تلاش میکنند این اقدام را با عباراتی مانند «حفظ دیجیتالی کتابها» معرفی کنند تا نگاه مثبتتری نسبت به این فرآیند ایجاد شود.

ارتباط خرید کتابهای قدیمی با پروندههای حقوقی هوش مصنوعی
استفاده از کتابها برای آموزش مدلهای هوش مصنوعی، در سالهای اخیر به یکی از موضوعات مهم حقوقی تبدیل شده است.
شرکتهای هوش مصنوعی با شکایتهای متعددی از سوی نویسندگان و ناشران روبهرو شدهاند که معتقدند آثار آنها بدون اجازه برای آموزش مدلها استفاده شده است.
در یکی از پروندههای مهم، دادگاهی در آمریکا با توافق مالی شرکت Anthropic درباره استفاده از کتابهای دارای حق نشر موافقت کرد و آموزش مدلهای هوش مصنوعی با استفاده از کتابهای خریداریشده و اسکنشده را در شرایطی خاص قابل قبول دانست.
یکی از استدلالهای مطرحشده این بود که نسخه چاپی خریداریشده پس از اسکن شدن از بین میرود و در عمل جایگزین یک نسخه قانونی دیگر میشود.
این موضوع نشان میدهد که خرید کتابهای قدیمی و جدید و تبدیل آنها به داده دیجیتال ممکن است به یکی از مسیرهای مورد قبول شرکتهای هوش مصنوعی برای کاهش مشکلات حقوقی تبدیل شود.
آینده هوش مصنوعی به دادههای انسانی وابسته است
شرکتهای فناوری سالها تلاش کردند تمام دانش بشری را دیجیتالی کنند، اما اکنون با یک واقعیت جدید روبهرو شدهاند؛ ارزشمندترین دادهها شاید همان اطلاعاتی باشند که هنوز توسط انسانها نوشته شدهاند.
کتابهای قدیمی به دلیل داشتن نویسنده مشخص، فرآیند ویرایش انسانی و تاریخ انتشار روشن، به یکی از منابع مهم برای توسعه نسل آینده هوش مصنوعی تبدیل شدهاند.
با افزایش تولید محتوای ماشینی، پیدا کردن جملههایی که هیچگاه توسط هوش مصنوعی لمس نشدهاند، به یک چالش جدی تبدیل شده است.
به نظر میرسد در رقابت آینده هوش مصنوعی، فقط حجم داده اهمیت ندارد؛ بلکه کیفیت، اصالت و انسانی بودن دادهها نقش تعیینکنندهای خواهند داشت.