آیا یک فراخوان بازیابی، رکورد کامل یک مقاله را برمیگرداند یا دقیقاً همان پاراگرافی را که پاسخ سؤال است؟ این انتخاب معماری ساده، تعیین میکند که یک عامل پژوهشی چقدر کاربردی باشد و طبق راهنمای فنی منتشر شده در ۲۸ اوت ۲۰۲۶، مشخص میکند که توسعهدهنده سه هفته آینده را صرف ساخت یک خط لوله سفارشی میکند یا یک محصول نهایی را مستقر میسازد.
بسیاری از توسعهدهندگان با جستوجوی آکادمیک مانند یک بلوک واحد برخورد میکنند، اما صنعت اکنون به دو پارادایم متمایز تقسیم شده است. یک سو، رویکرد «اول-رکورد» (Metadata-first) است که برای کشف و نقشهبرداری از نفوذ مقالات طراحی شده است. در سوی دیگر، رویکرد «اول-شاهد» (Evidence-first) قرار دارد که برای سنتز و حسابرسی دادهها ساخته شده است. درک این شکاف، تفاوت بین عاملی است که صرفاً فهرستی از مقالات برای خواندن پیشنهاد میدهد و عاملی که یک گزارش پزشکی مستند و دارای استناد مینویسد.
پارادایم اول-رکورد: Semantic Scholar
Semantic Scholar که توسط مؤسسه Allen برای هوش مصنوعی اداره میشود، مانند یک موتور جستوجوی عظیم و یک API متاداده عمل میکند. این ابزار برای «واحد کاری» به نام رکورد ساخته شده است. اگر عامل شما نیاز دارد مقالات را بر اساس موضوع بیابد، در گراف استنادی حرکت کند یا پژوهشگران را بر اساس میزان نفوذ رتبهبندی کند، این ابزار اصلی است.
مقیاس گراف آکادمیک Semantic Scholar بسیار گسترده است و ۲۱۴ میلیون مقاله، ۲.۴۹ میلیارد استناد و ۷۹ میلیون نویسنده را پوشش میدهد. این پوشش تمام حوزهها را شامل میشود و از فیدهای ناشران، سرورهای پیشچاپ و خزش وب جمعآوری شده است. API آن به سه سرویس اصلی تقسیم میشود:
- گراف آکادمیک: مدیریت جستوجوی مقالات، جستوجوی انبوه (bulk search)، تطبیق عنوان، تکمیل خودکار (autocomplete)، جستوجوی تکه-متن، جزئیات مقاله، جستوجوی دستهای، استنادات، مراجع و جستوجوی نویسنده.
- توصیهها: یافتن مقالات مشابه با یک مقاله خاص یا یک مجموعه از نمونههای مثبت/منفی.
- مجموعه دادهها: ارائه دانلودهای انبوه بدنه مقالات، از جمله S2ORC.
با این حال، متن کامل در اینجا یک محصول در زمان پرسوجو نیست. برای جستوجو در داخل مقالات، توسعهدهندگان باید مجموعه داده S2ORC را دانلود کنند — که شامل بیش از ۸ میلیون مقاله متن کامل در کنار ۸۱ میلیون گره مقاله و ۷۳ میلیون چکیده است — و زیرساخت بردار معنایی (Embedding) — مثل کارت معرفی عددی برای هر واژه که میگوید این کلمه «همسایهی» چه کلمات دیگری است — و پایگاهداده برداری خود را میزبانی کنند. این رویکرد یادآور پیادهسازیهای بهینهای است که در آن جستوجوی معنایی برای حذف هزینههای API در مرورگر به کار گرفته شده تا دسترسی به دادهها سریعتر و ارزانتر شود. این کار مستلزم مدیریت ذخیرهسازی اشیاء (object storage)، مدیریت کارهای Embedding و استراتژی بهروزرسانی بدنه است. اگرچه یک نقطه اتصال برای جستوجوی تکه-متن در مقالات دسترسی-آزاد وجود دارد، اما این سرویس تنها عصارههای کوتاهی ارائه میدهد، نه قطعات عمیقی که برای خط لولههای تولیدی تولید بازیابیافزا (RAG) — مثل دانشآموزی که قبل از جواب دادن، اول کتاب درسی را باز میکند و از آن نقل میآورد — لازم است.

پارادایم اول-شاهد: Valyu
در مقابل، Valyu به عنوان یک API جستوجو و پژوهش عمیق (DeepResearch) عمل میکند که متن کامل را با استنادات ساختاریافته از منابع آکادمیک، بالینی و نظارتی بازیابی میکند. طراحی این ابزار بر این فرض استوار است که واحد کاری، یک «قطعه شاهد» است. بهجای بازگرداندن فهرستی از مقالات، دقیقاً متنی را برمیگرداند که پاسخ پرسوجو است.
اندکس Valyu کوچکتر اما در حوزههای خاص عمیقتر است. این ابزار حدود ۴ میلیون مقاله دسترسی-آزاد، شامل ۲.۵ میلیون مورد از PubMed، ۱ میلیون از arXiv، ۳۵۰ هزار مورد از bioRxiv، ۸۰ هزار مورد از medRxiv و ۸ هزار مورد از ChemRxiv، به علاوه محتوای مجلات دارای لایسنس را پوشش میدهد. نکته حیاتی این است که Valyu فراتر از محیط دانشگاهی میرود و شامل موارد زیر است:
- ClinicalTrials.gov: بیش از ۵۰۰,۰۰۰ کارآزمایی بالینی.
- DailyMed: ۱۵۰,۰۰۰ برچسب دارویی FDA.
- USPTO و EPO: ۱۴ میلیون پتنت (۸ میلیون USPTO و ۶ میلیون EPO) با متن کامل و اشکال.
- SEC Filings: ۳ میلیون رکورد گزارشهای مالی.
- منابع تخصصی: دادههای ژنومیک و شیمی.
این ایندکسینگ بینحوزهای به یک عامل اجازه میدهد تا یک مکانیسم علمی را از یک مقاله پژوهشی به یک کارآزمایی بالینی و در نهایت به یک برچسب داروی تأییدشده در یک جریان پرسوجوی واحد ردیابی کند.
پیادهسازی فنی و منشأ دادهها
همانطور که در تحلیلهای قبلی ما درباره امنیت مدلهای بازمتن اشاره کردیم، قابلیت ردیابی منبع در سیستمهای عاملمحور حیاتی است. برای توسعهدهندگان، این تفاوت در پاسخ JSON ظاهر میشود. یک فراخوان در Semantic Scholar مقادیر paperId، عنوان، چکیده و تعداد استنادات را برمیگرداند. اما فراخوان Valyu محتوای پاسخ (قطعه شاهد) و یک شیء استناد شامل doi، نویسندگان و یک لینک عمیق به تکه-متن (fragment) را ارائه میدهد.
این لینک عمیق به کاربر اجازه میدهد تا با کلیک بر روی استناد، دقیقاً روی همان جمله در مقاله فرود بیاید، نه در ابتدای صفحه. این قابلیت، عامل را از حالت «حرف من را باور کنید» به حالت «کاملاً قابل حسابرسی» منتقل میکند. برای تضمین این دقت در خروجیهای ساختاریافته، استفاده از گیتهای JSON برای کنترل خروجی و جلوگیری از توهمات AI در معماریهای تریاژ مدرن به یک استاندارد تبدیل شده است.
یک نکته فنی مهم درباره پوشش PubMed در Valyu وجود دارد. بهطور پیشفرض، API مقالاتی را برمیگرداند که متن کامل آنها موجود است و چکیده را به همراه مرتبطترین تکههای متن کامل ارائه میدهد. اما اگر توسعهدهنده پرچم include_abstracts=true را فعال کند، جستوجو به کل ۳۷ میلیون رکورد چکیده PubMed گسترش مییابد. در این حالت، مقالاتی که متن کامل ندارند، فقط چکیده خود را برمیگردانند. این یک موازنه بین عمق شواهد (پیشفرض) و وسعت پوشش (اختیاری) است؛ مورد دوم برای غربالگریهای سبک مرور سیستماتیک (systematic-review) که در آن از دست دادن یک مقاله بدتر از داشتن تنها یک چکیده است، مفید است.
سنتز و پژوهش خودکار
قابلیتهای سنتز نیز این دو را از هم جدا میکند. Semantic Scholar تولید پاسخ را در API خود ارائه نمیدهد. اگرچه تیم AI2 سیستم Ai2 Scholar QA را به صورت متنباز عرضه کرده است، اما این یک زیرساخت مجزا است که بیش از ۱۱ میلیون مقاله متن کامل و ۱۰۰ میلیون چکیده را پوشش میدهد و به صورت اپلیکیشن Docker، API ناهمگام (async) یا بسته پایتون در دسترس است. با این حال، توسعهدهنده باید آن را میزبانی کرده و کلیدهای مدل زبانی بزرگ (LLM) خود را از OpenAI یا Anthropic فراهم کند.
در مقابل، Valyu سنتز را به عنوان یک سرویس مدیریتشده در چندین سطح ارائه میدهد:
- Answer API: تولید پاسخ مستند در یک فراخوان واحد.
- DeepResearch: اجرای تحقیقات چندمرحلهای خودکار شامل برنامهریزی، جستوجو، استخراج، تأیید واقعیت و گزارشنویسی. این سرویس از پارامترهای
research_strategyوreport_formatبرای کدگذاری متدولوژیهای تخصصی پشتیبانی میکند. - Workflows: اجراهای تکرارپذیر و نسخهبندی شده DeepResearch برای کارهای روتین.
سرویس DeepResearch میتواند خروجیها را در قالبهای PDF، XLSX، DOCX، PPTX و CSV ارائه دهد و از وبهوکها و نقاط بازرسی انسانی (human-in-the-loop) برای کارهای طولانیمدت که دقایق زمان میبرند (به جای میلیثانیهها) پشتیبانی میکند. برای مثال، کاربر میتواند با فعال کردن ابزارهای اجرای کد (code_execution)، یک جدول مکانیسم-بر-اساس-شاهد را در قالب XLSX دریافت کند.
محدودیتهای تولیدی: نرخ فراخوان و هزینه
ساختار هزینهها نیز گلوگاههای متفاوتی ایجاد میکند. Semantic Scholar رایگان است اما محدودیتهای نرخ (Rate Limits) سختگیرانهای دارد که اغلب اشتباه تفسیر میشوند. کاربران بدون کلید API، در یک سهمیه مشترک جهانی (۱,۰۰۰ درخواست در ثانیه برای کل دنیا) قرار دارند که مشمول محدودیتهای شدید است. کاربران دارای کلید API، به سقف اختصاصی ۱ درخواست در ثانیه در تمام نقاط اتصال محدود شدهاند. این سقف سخت، استفاده از نقاط اتصال دستهای (batch) و جستوجوی انبوه (با استفاده از توکنهای ادامه) را برای هر طراحی مقیاسپذیر ضروری میکند.
Valyu از مدل قیمتگذاری مبتنی بر مصرف استفاده میکند که بر اساس هر هزار نتیجه و بر اساس نوع منبع قیمتگذاری میشود. برای جلوگیری از هزینههای پیشبینینشده، یک سقف هزینه (max_price) برای هر پرسوجو تعریف شده است. اگر منبع درخواستی از این سقف فراتر رود، API هشدار موفقیت جزئی (۲۰۶) را برمیگرداند و منبع گرانقیمت را حذف میکند. کاربران جدید میتوانند با ۱۰ دلار اعتبار رایگان، یا ۲۰ دلار با ایمیل کاری شروع کنند.
مقایسه تفصیلی قابلیتها
برای درک بهتر این شکاف معماری، نگاهی به مکانیسمهای خاص هر API میاندازیم:
مکانیسمهای جستوجو و کشف
- Semantic Scholar: از پارامتر
fieldsبرای کنترل دادههای بازگشتی در سمت سرور استفاده میکند. درخواست بدون فیلد تقریباً هیچ چیزی برنمیگرداند و محدود نگه داشتن این لیست برای عملکرد ضروری است. برای مجموعههای بزرگ، بهجای صفحهبندی استاندارد، از نقطه اتصال جستوجوی انبوه با توکنهای ادامه استفاده میکند. نحو پرسوجوی انبوه آن از|برای OR، علامت-در ابتدا برای نفی و پرانتز برای گروهبندی استفاده میکند. - Valyu: گزینه
search_type="proprietary"و فیلتر بر اساس منابع خاص (مانندvalyu/valyu-pubmedیاvalyu/valyu-clinical-trials) را ارائه میدهد و اجازه میدهد تنظیمresponse_length="large"برای بازیابی کامل متدولوژی و نتایج بهجای صرفاً چکیدهها فعال شود.
منشأ دادهها و خروجی
- Semantic Scholar: رکوردهای JSON را برمیگرداند و منشأ دادهها از طریق IDها، DOIها و تعداد استنادات ردیابی میشود.
- Valyu: خروجیهای متنوعی از JSON، Markdown، PDF، XLSX، DOCX، PPTX و CSV ارائه میدهد. منشأ دادهها شامل عنوان، URL، DOI، محل انتشار، نویسندگان و لینک عمیق در سطح پاراگراف است.
سنتز و جریانهای کاری عاملمحور
- Semantic Scholar: تولید پاسخ بومی ندارد و نیازمند میزبانی شخصی Ai2 Scholar QA برای سنتز مستند است.
- Valyu: دارای Answer API و DeepResearch مدیریتشده است. DeepResearch اجازه میدهد استراتژیهای پیچیده پژوهشی (مثلاً اولویت دادن به کارآزماییهای تصادفی (RCT) در برابر مطالعات مشاهدهای) و قالبهای گزارش (مثلاً جداول خلاصه شواهد با ذکر n، جمعیت و اندازه اثر) تعریف شود.
تحلیل تحریریه: استراتژی ترکیبی
این مقایسه نشان میدهد که «بهترین» API موضوع کیفیت نیست، بلکه هدف طراحی است. Semantic Scholar نقشهای از چشمانداز علمی است و Valyu میکروسکوپی برای ادعاهای خاص. برای یک عامل پژوهشی در سطح حرفهای، مؤثرترین معماری احتمالاً یک خط لوله ترکیبی است.
در یک جریان ترکیبی، عامل از Semantic Scholar برای شناسایی تأثیرگذارترین مقالات از طریق گراف استنادی استفاده میکند و سپس برای استخراج دقیق قطعات شواهد مورد نیاز برای پشتیبانی از یک ادعا، به Valyu تغییر وضعیت میدهد. این ترکیب، قدرت کشف یک گراف ۲۱۴ میلیون مقالهای را با دقت منشأ در سطح پاراگراف ادغام میکند.
برای توسعهدهنده، این تغییر به معنای حرکت از «جستوجوی عمومی» به سمت «بازیابی مبتنی بر قصد» است. اگر هدف کتابشناسی، ردیابی استنادات رو به جلو/عقب یا رفع ابهام نویسنده است، گراف را انتخاب کنید. اگر هدف گزارشی است که یک متخصص انسانی باید آن را حسابرسی کند، قطعات شواهد را برگزینید.
برای مشاهده این مدل در عمل، توسعهدهندگان میتوانند سرور MCP میزبانیشده، CLI یا پلاگین Claude Code شرکت Valyu را بررسی کنند. این سرویس همچنین با Vercel AI SDK، LangChain، LlamaIndex، AWS Bedrock AgentCore و n8n ادغام شده است و تعاریف ابزار (tool definitions) برای Anthropic، OpenAI و Google را فراهم میکند تا فرآیند یکپارچهسازی به یک تغییر پیکربندی ساده تبدیل شود، نه ساخت یک کلاینت سفارشی. برای درک مقیاس، RevisionDojo از SDKهای جاوااسکریپت و AI شرکت Valyu برای ارائه پژوهشهای آکادمیک به بیش از ۴۵۰,۰۰۰ دانشآموز برای مقالات Extended Essay در سیستم IB استفاده میکند.
گام بعدی شما
- اگر در حال ساخت عامل پژوهشی هستید، ابتدا تعیین کنید آیا خروجی شما یک «فهرست منابع» است یا یک «گزارش مستند»؛ این تصمیم ابزار شما را تعیین میکند.
- برای کاهش هزینههای استنتاج، از استراتژی ترکیبی استفاده کنید: شناسایی مقالات با Semantic Scholar و استخراج شواهد با Valyu.
- قابلیت DeepResearch در Valyu را برای خودکارسازی گزارشهای متدولوژی-محور (مانند جداول مقایسهای RCT) تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما درباره تراشههای Blackwell مراجعه کنید.




گفتگو