عاملهای هوش مصنوعی علمی اغلب خلاصههایی متقاعدکننده میسازند، بدون آنکه هرگز منبع اصلی را خوانده باشند. ردپاین (Redpine) قصد دارد با فراهم کردن دسترسی لایسنسشده، قابلردیابی و پولی به ۲۰ میلیون مقاله داوریشده، این شکاف میان «ظاهرِ دانستن» و «واقعاً دانستن» را پر کند.
این تحول در حالی رخ میدهد که صنعت با تنش میان آموزش مدلهای زبانی و قوانین کپیرایت دستوپنجه نرم میکند. در حالی که بسیاری از مدلها به دادههای جذبشده در زمان آموزش تکیه میکنند — که میتواند منجر به توهم (Hallucination) شود — روند فعلی به سمت تولید بازیابیافزا (RAG) تغییر کرده است. با وارد کردن ادبیات اولیه به جریان کاری فعال، توسعهدهندگان میتوانند پاسخهای هوش مصنوعی را بهجای حافظه احتمالی، بر شواهد قابلتأیید مبنیسازی (Grounding) کنند. این رویکرد در راستای استراتژیهای جدیدی است که در آن آزمایشگاههای هوش مصنوعی برای دسترسی به دادههای باکیفیت و عملیاتی، پرداختهای مستقیم را جایگزین خزش رایگان کردهاند.
همانطور که در تحلیلهای پیشین ما دربارهی امنیت دادههای آموزشی اشاره کردیم، تکیه بر حافظه داخلی مدلها برای دادههای حساس علمی ریسک بالایی دارد. به همین دلیل، در ۶ اکتبر ۲۰۲۴، این شرکت سوئدی مشارکتهایی را با ناشرانی چون BMJ Group، Sage، IOP Publishing، IGI Global Scientific Publishing، Wanfang Data و RCNi اعلام کرد. این قراردادها دسترسی لایسنسشده را از طریق APIها و پروتکل زمینهٔ مدل (MCP) فراهم میکند تا ابزارهایی مانند Claude، Cursor و ChatGPT بهجای چکیدهها، متن کامل و جداول را استخراج کنند.
ادغام ناشران و بستر محتوایی
این مشارکتها طیف متنوعی از محتواهای علمی، از علوم فیزیکی و پرستاری گرفته تا پژوهشهای چینی را شامل میشود. طبق اعلام شرکت، یکی از بخشهای مهم این عرضه، طرح آزمایشی با Sage است که بیش از ۴۰۰ مجله علوم پزشکی و زیستی، از جمله عناوین Mary Ann Liebert را پوشش میدهد.
برای ناشران، جذابیت اصلی در مدل تراکنشی با شرایط صریح است. ردپاین بخش بزرگی از درآمدهای خود را با این شرکا تقسیم میکند. با این حال، بر اساس مستندات منتشر شده، این اعلان مشخص نمیکند که نویسندگان بهصورت فردی چگونه تحت قراردادهای نشر خود از این مدل سود میبرند؛ بنابراین این لزوماً به معنای وعده پرداخت مستقیم حقالکتاب (Royalties) به هر پژوهشگر نیست.
پیادهسازی فنی و ساختار هزینهها
معماری ردپاین بر بازیابی در زمان استنتاج (Inference) متمرکز است و منطق زیر را دنبال میکند:
- مکانیزم بازیابی: مدل پرسش را دریافت کرده، متریال مرتبط را از منبع لایسنسشده خارجی درخواست میکند و از آن متن خاص بهعنوان زمینه (Context) برای پاسخ استفاده میکند. این فرآیند تضمین میکند که شواهد بدون پیشفرضِ «جذب در زمان آموزش»، وارد گفتگو شوند.
- قابلیت ردیابی: هر قطعه بازیابیشده شامل شناسههای مقاله مانند DOI و ارجاع به صفحه است تا کاربر بتواند ادعاها را با منبع اصلی تطبیق دهد. این رویکرد، چالش را از داخل مدل به فرآیند یافتن و نمایش صادقانه شواهد منتقل میکند. این قابلیت ردیابی، زیرساختی حیاتی برای ابزارهایی است که قصد دارند مقالات پژوهشی را به کدهای قابل اجرا تبدیل کرده و نتایج آنها را بازتولید کنند.
- مدل قیمتگذاری: دسترسی بدون اشتراک ماهانه و به مبلغ ۱ دلار بهازای هر ۱۰۰۰ توکن (Token) قیمتگذاری شده است؛ یعنی هزینهها متناسب با حجم شواهد بازیابیشده توسط عامل افزایش مییابد. توکنها در واقع واحدهای متنی هستند که توسط نرمافزار پردازش میشوند.
برای مدیریت این هزینهها، ردپاین گردش کار «پیشنمایش و باز کردن» (preview-and-unlock) را پیاده کرده است. این قابلیت به اپلیکیشنها اجازه میدهد پیش از پرداخت برای باز کردن متن کامل، پیشنمایشی از نتایج (Teasers) و تخمین هزینهها را بررسی کنند. این یک گردش کار اضافی است و به معنای رایگان بودن نقاط انتهایی (Endpoints) جستوجو نیست.
علاوه بر این، ویژگی «جستوجوی کمکی» (Assisted Search) درخواستهای پیچیده را به جنبههای مختلف تقسیم کرده و چندین جستوجوی داخلی را اجرا میکند تا ارزیابی کند آیا کاندیداهای مفید کافی در اختیار دارد یا خیر. نتایج کاندید را با پرسش اصلی چک میکند و در صورت عدم وجود نتیجه مرتبط، ممکن است هیچ نتیجهای برنگرداند. ردپاین هزینههای داخلی این جستوجوها و مدلهای زبانی مربوطه را جذب کرده و از مشتری تنها برای نتایج تأییدشده و تحویلشده هزینه میگیرد.
محکهای عملکردی
در ارزیابی منتشر شده توسط شرکت، یک عامل با جستوجوی وب استاندارد در برابر عاملی با ترکیب وب و Redpine Science آزمایش شد. بر اساس این گزارش، در ۱۷۹ پرسش زیستپزشکی که توسط متخصصان تأیید شده بود، نرخ صحت (بر اساس پوشش ادعاها و نبود تضاد) از ۷۵.۹٪ به ۸۴.۷٪ رسید که افزایشی ۸.۸ درصدی است. یک داور دوم نیز بهبود مشابهی را گزارش کرد.
این بهبود نشان میدهد دادههای لایسنسشده و باکیفیت، فاصله میان «پاسخهای باورپذیر» و «پاسخهای علمی دقیق» را بهشدت کاهش میدهند. با این حال، شرکت اشاره کرد که مرتبط بودن پاسخ با پرسش، لزوماً به معنای اعتبار علمی آن نیست؛ ممکن است متنی کاملاً با پرسش مطابقت داشته باشد اما توصیفکننده مطالعهای با نمونه کوچک، یک ارتباط نامطمئن یا یافتههای قدیمی باشد. در همین راستا، پلتفرمهای نشر علمی برای حفظ کیفیت، محدودیتهای جدیدی را برای مهار سیل مقالات تولیدشده توسط هوش مصنوعی وضع کردهاند.
برای جامعه فنی، این مدل فرض رایج مبنی بر اینکه دادههای علمی باید «خزش» (Scrape) یا «جذب» شوند تا مفید باشند را تغییر میدهد. این یک لایه تراکنشی است که در آن ناشران قیمت و کاربردهای مجاز را تعیین میکنند و ردپاین اکثریت درآمد را با شرکای خود تقسیم میکند. این مدل یک خط لوله پایدار ایجاد میکند تا ادبیات اولیه بدون دور زدن منافع اقتصادی ناشران، وارد جریانهای کاری هوش مصنوعی شود.
اکنون آزمون اصلی این است که آیا توسعهدهندگان لایه پولی «پرداخت به ازای استفاده» را به جستوجوی رایگان اما کمکیفیت وب ترجیح میدهند یا خیر. موفقیت این پلتفرم بستگی به این دارد که آیا افزایش دقت، هزینههای انباشته توکن را برای وظایف پیچیده پژوهشی توجیه میکند یا نه. پژوهشگران همچنان به متدهای مرتبط، محدودیتها و یافتههای متناقض نیاز دارند، نه صرفاً مجموعهای بزرگ از مقالات.
باید منتظر ماند و دید ناشران بزرگ دانشگاهی دیگر به این مدل تقسیم درآمد چه واکنشی نشان میدهند و آیا محکهای مستقل، افزایش ۸.۸ درصدی دقت را در محیطهای بالینی تأیید میکنند یا خیر، زیرا این نتایج در حال حاضر یافتههای گزارششده توسط فروشنده از یک محک تعریفشده هستند.
گام بعدی شما
- اگر توسعهدهنده ابزارهای پژوهشی هستید، پروتکل MCP را برای اتصال عاملهای خود به منابع دادهای ساختاریافته بررسی کنید.
- در طراحی سیستمهای RAG، مدلهای پرداخت به ازای توکن را برای مدیریت هزینههای بازیابی دادههای تخصصی مدلسازی کنید.
- برای اعتبارسنجی خروجیهای مدل، سیستمهای ردیابی DOI را در لایه رابط کاربری (UI) پیاده کنید.
اما تأثیر این مدل بر اقتصاد نشر علمی در بلندمدت پیچیدهتر است — به تحلیل ما دربارهی آینده کپیرایت در عصر هوش مصنوعی مراجعه کنید.




گفتگو