تکنولوژی

کتاب‌های قدیمی ؛ گنج جدید هوش مصنوعی

کتاب‌های قدیمی؛ گنج جدید هوش مصنوعی

شرکت‌های فعال در حوزه هوش مصنوعی برای توسعه مدل‌های زبانی بزرگ، به حجم عظیمی از داده‌های متنی یعنی کتاب‌های قدیمی نیاز دارند. اما در سال‌های اخیر یک مشکل جدید به وجود آمده است؛ بخش قابل توجهی از محتوای موجود در اینترنت دیگر توسط انسان‌ها نوشته نمی‌شود و با کمک ابزارهای هوش مصنوعی تولید شده است.

همین موضوع باعث شده برخی متخصصان نگران پدیده‌ای به نام «آلودگی داده‌ها» در فرآیند آموزش مدل‌های هوش مصنوعی باشند. مدل‌هایی که با داده‌های تولیدشده توسط ماشین‌ها آموزش ببینند، ممکن است به مرور کیفیت خود را از دست بدهند و اطلاعات نادرست یا تکراری بیشتری تولید کنند.

در چنین شرایطی، یک منبع قدیمی دوباره مورد توجه قرار گرفته است: کتاب‌های قدیمی چاپی که سال‌ها پیش از ظهور چت‌بات‌های هوش مصنوعی منتشر شده‌اند.

شرکت داده‌پرداز ISBNdb معتقد است بهترین داده‌های آموزشی برای هوش مصنوعی هنوز روی قفسه کتابخانه‌ها قرار دارند؛ داده‌هایی انسانی، ویرایش‌شده و قابل اعتماد که پیش از ورود هوش مصنوعی مولد به بازار نوشته شده‌اند.

کتاب‌های چاپ شده قبل از دوران چت‌بات‌ها؛ منبعی ارزشمند برای آموزش AI

شرکت ISBNdb که خود را یکی از بزرگ‌ترین پایگاه‌های اطلاعاتی کتاب در جهان معرفی می‌کند، اکنون تأمین کتاب‌های قدیمی فیزیکی برای آزمایشگاه‌های هوش مصنوعی را آغاز کرده است تا این کتاب‌ها به داده‌های آموزشی مدل‌های جدید تبدیل شوند.

این شرکت معتقد است کتاب‌های چاپ‌شده قبل از سال ۲۰۲۲ ارزش ویژه‌ای دارند؛ زیرا قبل از گسترش مدل‌های زبانی بزرگ مانند ChatGPT منتشر شده‌اند و احتمال وجود متن‌های تولیدشده توسط هوش مصنوعی در آن‌ها بسیار کم است.

برخلاف محتوای اینترنتی که هر روز با حجم زیادی از نوشته‌های تولیدشده توسط ماشین‌ها روبه‌رو است، کتاب‌های چاپی یک سند ثابت و انسانی محسوب می‌شوند. محتوای یک کتاب چاپ‌شده را نمی‌توان مانند یک صفحه اینترنتی به‌صورت پنهانی تغییر داد یا با متن‌های ماشینی ترکیب کرد.

به همین دلیل، شرکت‌های هوش مصنوعی این کتاب‌ها را نوعی منبع داده معتبر می‌دانند که می‌تواند کیفیت آموزش مدل‌ها را افزایش دهد.

کتاب‌های قدیمی؛ گنج جدید هوش مصنوعی

مشکل بزرگ هوش مصنوعی؛ خطر آموزش با داده‌های تولیدشده توسط خودش

یکی از نگرانی‌های مهم در توسعه هوش مصنوعی، پدیده‌ای به نام «فروپاشی مدل» یا Model Collapse است. این اتفاق زمانی رخ می‌دهد که یک مدل هوش مصنوعی با داده‌هایی آموزش ببیند که خود مدل‌های قبلی تولید کرده‌اند.

در این شرایط، هر نسل جدید از مدل‌ها ممکن است بخشی از کیفیت و تنوع داده‌های انسانی را از دست بدهد. در نهایت، سیستم‌هایی ایجاد می‌شوند که بیشتر از آنکه اطلاعات واقعی تولید کنند، بازتولیدکننده اشتباهات و محدودیت‌های مدل‌های قبلی هستند.

رشد سریع محتوای تولیدشده توسط هوش مصنوعی در اینترنت این نگرانی را افزایش داده است. امروزه حجم زیادی از مقالات، توضیحات محصول، پست‌های شبکه‌های اجتماعی و متن‌های عمومی با ابزارهای هوش مصنوعی نوشته می‌شوند.

به همین دلیل، برخی شرکت‌ها به دنبال داده‌هایی هستند که پیش از ورود گسترده هوش مصنوعی تولید شده باشند؛ داده‌هایی که منشأ انسانی مشخصی دارند.

چالش اخلاقی و تصویری خرید و نابودی میلیون‌ها کتاب

با وجود ارزش بالای این کتاب‌های قدیمی برای آموزش هوش مصنوعی، یک مسئله بحث‌برانگیز وجود دارد: فرآیند استخراج اطلاعات از کتاب‌های فیزیکی.

برای اسکن سریع تعداد زیادی کتاب، معمولاً لازم است جلد و عطف کتاب جدا شود تا صفحات بتوانند با سرعت بالا وارد دستگاه‌های اسکن شوند. این روش باعث از بین رفتن نسخه فیزیکی کتاب می‌شود.

شرکت ISBNdb نیز به این موضوع اشاره کرده و برای مشتریان خود قراردادهای محرمانگی ارائه می‌دهد. نام شرکت‌هایی که این کتاب‌ها را خریداری می‌کنند، منتشر نمی‌شود.

دلیل این محرمانگی، نگرانی درباره واکنش عمومی است. تصور اینکه یک شرکت هوش مصنوعی میلیون‌ها کتاب را خریداری کرده و سپس آن‌ها را برای استخراج داده از بین ببرد، می‌تواند تصویر منفی برای افکار عمومی ایجاد کند.

برخی شرکت‌ها تلاش می‌کنند این اقدام را با عباراتی مانند «حفظ دیجیتالی کتاب‌ها» معرفی کنند تا نگاه مثبت‌تری نسبت به این فرآیند ایجاد شود.

کتاب‌های قدیمی؛ گنج جدید هوش مصنوعی

ارتباط خرید کتاب‌های قدیمی با پرونده‌های حقوقی هوش مصنوعی

استفاده از کتاب‌ها برای آموزش مدل‌های هوش مصنوعی، در سال‌های اخیر به یکی از موضوعات مهم حقوقی تبدیل شده است.

شرکت‌های هوش مصنوعی با شکایت‌های متعددی از سوی نویسندگان و ناشران روبه‌رو شده‌اند که معتقدند آثار آن‌ها بدون اجازه برای آموزش مدل‌ها استفاده شده است.

در یکی از پرونده‌های مهم، دادگاهی در آمریکا با توافق مالی شرکت Anthropic درباره استفاده از کتاب‌های دارای حق نشر موافقت کرد و آموزش مدل‌های هوش مصنوعی با استفاده از کتاب‌های خریداری‌شده و اسکن‌شده را در شرایطی خاص قابل قبول دانست.

یکی از استدلال‌های مطرح‌شده این بود که نسخه چاپی خریداری‌شده پس از اسکن شدن از بین می‌رود و در عمل جایگزین یک نسخه قانونی دیگر می‌شود.

این موضوع نشان می‌دهد که خرید کتاب‌های قدیمی و جدید و تبدیل آن‌ها به داده دیجیتال ممکن است به یکی از مسیرهای مورد قبول شرکت‌های هوش مصنوعی برای کاهش مشکلات حقوقی تبدیل شود.

آینده هوش مصنوعی به داده‌های انسانی وابسته است

شرکت‌های فناوری سال‌ها تلاش کردند تمام دانش بشری را دیجیتالی کنند، اما اکنون با یک واقعیت جدید روبه‌رو شده‌اند؛ ارزشمندترین داده‌ها شاید همان اطلاعاتی باشند که هنوز توسط انسان‌ها نوشته شده‌اند.

کتاب‌های قدیمی به دلیل داشتن نویسنده مشخص، فرآیند ویرایش انسانی و تاریخ انتشار روشن، به یکی از منابع مهم برای توسعه نسل آینده هوش مصنوعی تبدیل شده‌اند.

با افزایش تولید محتوای ماشینی، پیدا کردن جمله‌هایی که هیچ‌گاه توسط هوش مصنوعی لمس نشده‌اند، به یک چالش جدی تبدیل شده است.

به نظر می‌رسد در رقابت آینده هوش مصنوعی، فقط حجم داده اهمیت ندارد؛ بلکه کیفیت، اصالت و انسانی بودن داده‌ها نقش تعیین‌کننده‌ای خواهند داشت.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *