پرش به محتوای اصلی
پرش به محتوای مقاله

ردپاین ۲۰ میلیون مقاله علمی را برای عامل‌های هوش مصنوعی لایسنس کرد

·۱۵ مهر ۱۴۰۵۵ دقیقه مطالعه
توافق ناشران ردپاین برای در دسترس قرار دادن ۲۰ میلیون مقاله پژوهشی برای عامل‌های هوش مصنوعی
توافق ناشران ردپاین برای در دسترس قرار دادن ۲۰ میلیون مقاله پژوهشی برای عامل‌های هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ایجاد نخستین لایه تراکنشی مقیاس‌پذیر (Pay-per-token) برای دسترسی عامل‌های AI به مقالات علمی لایسنس‌شده، که جایگزین روش‌های غیرقانونی خزش داده یا تکیه بر حافظه احتمالی مدل می‌شود.

عامل‌های هوش مصنوعی علمی اغلب خلاصه‌هایی متقاعدکننده می‌سازند، بدون آنکه هرگز منبع اصلی را خوانده باشند. ردپاین (Redpine) قصد دارد با فراهم کردن دسترسی لایسنس‌شده، قابل‌ردیابی و پولی به ۲۰ میلیون مقاله داوری‌شده، این شکاف میان «ظاهرِ دانستن» و «واقعاً دانستن» را پر کند.

این تحول در حالی رخ می‌دهد که صنعت با تنش میان آموزش مدل‌های زبانی و قوانین کپی‌رایت دست‌وپنجه نرم می‌کند. در حالی که بسیاری از مدل‌ها به داده‌های جذب‌شده در زمان آموزش تکیه می‌کنند — که می‌تواند منجر به توهم (Hallucination) شود — روند فعلی به سمت تولید بازیابی‌افزا (RAG) تغییر کرده است. با وارد کردن ادبیات اولیه به جریان کاری فعال، توسعه‌دهندگان می‌توانند پاسخ‌های هوش مصنوعی را به‌جای حافظه احتمالی، بر شواهد قابل‌تأیید مبنی‌سازی (Grounding) کنند. این رویکرد در راستای استراتژی‌های جدیدی است که در آن آزمایشگاه‌های هوش مصنوعی برای دسترسی به داده‌های باکیفیت و عملیاتی، پرداخت‌های مستقیم را جایگزین خزش رایگان کرده‌اند.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت داده‌های آموزشی اشاره کردیم، تکیه بر حافظه داخلی مدل‌ها برای داده‌های حساس علمی ریسک بالایی دارد. به همین دلیل، در ۶ اکتبر ۲۰۲۴، این شرکت سوئدی مشارکت‌هایی را با ناشرانی چون BMJ Group، Sage، IOP Publishing، IGI Global Scientific Publishing، Wanfang Data و RCNi اعلام کرد. این قراردادها دسترسی لایسنس‌شده را از طریق APIها و پروتکل زمینهٔ مدل (MCP) فراهم می‌کند تا ابزارهایی مانند Claude، Cursor و ChatGPT به‌جای چکیده‌ها، متن کامل و جداول را استخراج کنند.

ادغام ناشران و بستر محتوایی

این مشارکت‌ها طیف متنوعی از محتواهای علمی، از علوم فیزیکی و پرستاری گرفته تا پژوهش‌های چینی را شامل می‌شود. طبق اعلام شرکت، یکی از بخش‌های مهم این عرضه، طرح آزمایشی با Sage است که بیش از ۴۰۰ مجله علوم پزشکی و زیستی، از جمله عناوین Mary Ann Liebert را پوشش می‌دهد.

برای ناشران، جذابیت اصلی در مدل تراکنشی با شرایط صریح است. ردپاین بخش بزرگی از درآمدهای خود را با این شرکا تقسیم می‌کند. با این حال، بر اساس مستندات منتشر شده، این اعلان مشخص نمی‌کند که نویسندگان به‌صورت فردی چگونه تحت قراردادهای نشر خود از این مدل سود می‌برند؛ بنابراین این لزوماً به معنای وعده پرداخت مستقیم حق‌الکتاب (Royalties) به هر پژوهشگر نیست.

پیاده‌سازی فنی و ساختار هزینه‌ها

معماری ردپاین بر بازیابی در زمان استنتاج (Inference) متمرکز است و منطق زیر را دنبال می‌کند:

  • مکانیزم بازیابی: مدل پرسش را دریافت کرده، متریال مرتبط را از منبع لایسنس‌شده خارجی درخواست می‌کند و از آن متن خاص به‌عنوان زمینه (Context) برای پاسخ استفاده می‌کند. این فرآیند تضمین می‌کند که شواهد بدون پیش‌فرضِ «جذب در زمان آموزش»، وارد گفتگو شوند.
  • قابلیت ردیابی: هر قطعه بازیابی‌شده شامل شناسه‌های مقاله مانند DOI و ارجاع به صفحه است تا کاربر بتواند ادعاها را با منبع اصلی تطبیق دهد. این رویکرد، چالش را از داخل مدل به فرآیند یافتن و نمایش صادقانه شواهد منتقل می‌کند. این قابلیت ردیابی، زیرساختی حیاتی برای ابزارهایی است که قصد دارند مقالات پژوهشی را به کدهای قابل اجرا تبدیل کرده و نتایج آن‌ها را بازتولید کنند.
  • مدل قیمت‌گذاری: دسترسی بدون اشتراک ماهانه و به مبلغ ۱ دلار به‌ازای هر ۱۰۰۰ توکن (Token) قیمت‌گذاری شده است؛ یعنی هزینه‌ها متناسب با حجم شواهد بازیابی‌شده توسط عامل افزایش می‌یابد. توکن‌ها در واقع واحدهای متنی هستند که توسط نرم‌افزار پردازش می‌شوند.

برای مدیریت این هزینه‌ها، ردپاین گردش کار «پیش‌نمایش و باز کردن» (preview-and-unlock) را پیاده کرده است. این قابلیت به اپلیکیشن‌ها اجازه می‌دهد پیش از پرداخت برای باز کردن متن کامل، پیش‌نمایشی از نتایج (Teasers) و تخمین هزینه‌ها را بررسی کنند. این یک گردش کار اضافی است و به معنای رایگان بودن نقاط انتهایی (Endpoints) جست‌وجو نیست.

علاوه بر این، ویژگی «جست‌وجوی کمکی» (Assisted Search) درخواست‌های پیچیده را به جنبه‌های مختلف تقسیم کرده و چندین جست‌وجوی داخلی را اجرا می‌کند تا ارزیابی کند آیا کاندیداهای مفید کافی در اختیار دارد یا خیر. نتایج کاندید را با پرسش اصلی چک می‌کند و در صورت عدم وجود نتیجه مرتبط، ممکن است هیچ نتیجه‌ای برنگرداند. ردپاین هزینه‌های داخلی این جست‌وجوها و مدل‌های زبانی مربوطه را جذب کرده و از مشتری تنها برای نتایج تأییدشده و تحویل‌شده هزینه می‌گیرد.

محک‌های عملکردی

در ارزیابی منتشر شده توسط شرکت، یک عامل با جست‌وجوی وب استاندارد در برابر عاملی با ترکیب وب و Redpine Science آزمایش شد. بر اساس این گزارش، در ۱۷۹ پرسش زیست‌پزشکی که توسط متخصصان تأیید شده بود، نرخ صحت (بر اساس پوشش ادعاها و نبود تضاد) از ۷۵.۹٪ به ۸۴.۷٪ رسید که افزایشی ۸.۸ درصدی است. یک داور دوم نیز بهبود مشابهی را گزارش کرد.

این بهبود نشان می‌دهد داده‌های لایسنس‌شده و باکیفیت، فاصله میان «پاسخ‌های باورپذیر» و «پاسخ‌های علمی دقیق» را به‌شدت کاهش می‌دهند. با این حال، شرکت اشاره کرد که مرتبط بودن پاسخ با پرسش، لزوماً به معنای اعتبار علمی آن نیست؛ ممکن است متنی کاملاً با پرسش مطابقت داشته باشد اما توصیف‌کننده مطالعه‌ای با نمونه کوچک، یک ارتباط نامطمئن یا یافته‌های قدیمی باشد. در همین راستا، پلتفرم‌های نشر علمی برای حفظ کیفیت، محدودیت‌های جدیدی را برای مهار سیل مقالات تولیدشده توسط هوش مصنوعی وضع کرده‌اند.

برای جامعه فنی، این مدل فرض رایج مبنی بر اینکه داده‌های علمی باید «خزش» (Scrape) یا «جذب» شوند تا مفید باشند را تغییر می‌دهد. این یک لایه تراکنشی است که در آن ناشران قیمت و کاربردهای مجاز را تعیین می‌کنند و ردپاین اکثریت درآمد را با شرکای خود تقسیم می‌کند. این مدل یک خط لوله پایدار ایجاد می‌کند تا ادبیات اولیه بدون دور زدن منافع اقتصادی ناشران، وارد جریان‌های کاری هوش مصنوعی شود.

اکنون آزمون اصلی این است که آیا توسعه‌دهندگان لایه پولی «پرداخت به ازای استفاده» را به جست‌وجوی رایگان اما کم‌کیفیت وب ترجیح می‌دهند یا خیر. موفقیت این پلتفرم بستگی به این دارد که آیا افزایش دقت، هزینه‌های انباشته توکن را برای وظایف پیچیده پژوهشی توجیه می‌کند یا نه. پژوهشگران همچنان به متدهای مرتبط، محدودیت‌ها و یافته‌های متناقض نیاز دارند، نه صرفاً مجموعه‌ای بزرگ از مقالات.

باید منتظر ماند و دید ناشران بزرگ دانشگاهی دیگر به این مدل تقسیم درآمد چه واکنشی نشان می‌دهند و آیا محک‌های مستقل، افزایش ۸.۸ درصدی دقت را در محیط‌های بالینی تأیید می‌کنند یا خیر، زیرا این نتایج در حال حاضر یافته‌های گزارش‌شده توسط فروشنده از یک محک تعریف‌شده هستند.

گام بعدی شما

  • اگر توسعه‌دهنده ابزارهای پژوهشی هستید، پروتکل MCP را برای اتصال عامل‌های خود به منابع داده‌ای ساختاریافته بررسی کنید.
  • در طراحی سیستم‌های RAG، مدل‌های پرداخت به ازای توکن را برای مدیریت هزینه‌های بازیابی داده‌های تخصصی مدل‌سازی کنید.
  • برای اعتبارسنجی خروجی‌های مدل، سیستم‌های ردیابی DOI را در لایه رابط کاربری (UI) پیاده کنید.

اما تأثیر این مدل بر اقتصاد نشر علمی در بلندمدت پیچیده‌تر است — به تحلیل ما درباره‌ی آینده کپی‌رایت در عصر هوش مصنوعی مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با ایجاد یک مدل اقتصادی پایدار برای ناشران، اعتبار داده‌های علمی در خروجی‌های AI را تضمین می‌کند. تکیه بر تخصص ناشران و ردیابی دقیق منابع، اعتماد کاربران حرفه‌ای به عامل‌های هوش مصنوعی را افزایش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های پرداخت ارزی و تحریم‌های API، دسترسی توسعه‌دهندگان ایرانی به این لایه تراکنشی دشوار است؛ اما این مدل الگویی برای ایجاد پایگاه‌های داده علمی لایسنس‌شده در سطح ملی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «جذب داده در زمان آموزش» با «بازیابی در زمان استنتاج» برای داده‌های علمی، یک چرخش راهبردی است. این مدل نشان می‌دهد که برای دقت‌های بالا در حوزه‌های تخصصی، مدل‌های زبانی نباید به عنوان «دانشگاه» عمل کنند، بلکه باید به عنوان «کتاب‌داران فوق‌سریع» که به منابع معتبر دسترسی دارند، به کار گرفته شوند. در واقع، ارزش مدل از «چه چیزی می‌داند» به «چگونه سریع‌ترین و دقیق‌ترین منبع را پیدا می‌کند» تغییر می‌یابد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.