تصور کنید یک برنامهنویس بخواهد هزاران صفحه متن خام را به دادههای ساختاریافته تبدیل کند، اما با هر «او» یا «آن» در متن، مدل هوش مصنوعی دچار سردرگمی شود. برای حل این مشکل، ابزاری سفارشی بر پایه Llama 3.3 70B توسعه یافته است که فرآیند حل ارجاعات (Coreference Resolution) — یعنی تبدیل ضمایر مبهم به موجودیتهای واضح و استاندارد — را کاملاً خودکار میکند. با پیادهسازی این قابلیت، توسعهدهندگان اکنون میتوانند متنهای پیادهشده از جلسات یا اسناد اداری را بدون نیاز به ویرایش دستی پاکسازی کرده و آنها را برای خط لولههای پردازش زبان طبیعی (NLP) آماده کنند.
حل ارجاعات یک چالش کلاسیک در NLP است که در آن سیستم باید تعیین کند آیا عبارات مختلف — مانند «او» و «آلیس» — به یک موجودیت واقعی در دنیای واقعی اشاره دارند یا خیر. همانطور که در تحلیل قبلی ما دربارهی ویژگیهای قابلیت اطمینان در فراخوانیهای مدلهای زبانی در محیط عملیاتی اشاره کردیم، در این پیادهسازی تمرکز اصلی بر خروجیهای قطعی و پیشبینیپذیری هزینههاست. برای اکثر کاربران، این ابزار مانند یک ویراستار خودکار عمل میکند که تضمین میکند هر «آن» یا «آنها» در یک متن ۱۰ صفحهای، به طور صریح به موضوع صحیح مرتبط شود.
زمینه و نیازمندیها
برای ساخت این ابزار، توسعهدهندگان به پایتون ۳.۱۰ یا نسخههای جدیدتر و SDK شرکت OpenAI نیاز دارند که از طریق دستور pip install openai نصب میشود. مدیریت دسترسیها نیز از طریق یک کلید API که از پورتال Oxlo.ai دریافت میشود، انجام میگیرد.
طبق آموزش منتشر شده در ۱۷ اوت ۲۰۲۶، این ابزار با استفاده از SDK شرکت OpenAI ساخته شده و به سمت درگاه Oxlo.ai هدایت شده است. معماری فنی این سیستم بر چندین مؤلفه کلیدی استوار است:
جزئیات فنی پیادهسازی
- انتخاب مدل: مدل Llama 3.3 70B به دلیل توانایی بالا در پیروی از دستورات ساختاریافته در ورودیهای طولانی و مدیریت تمیز اسناد حجیم انتخاب شده است.
- پرامپت سیستمی: مدل محدود شده است تا خروجی را صرفاً در قالب JSON معتبر و بدون هرگونه فرمتبندی Markdown ارائه دهد. مدل باید تمام اشارههای موجودیتها — شامل ضمایر، اسامی خاص و عبارات اسمی — را شناسایی کرده و آنها را در «زنجیرههای ارجاع» گروهبندی کند.
- طرحواره JSON: خروجی از یک طرحواره (Schema) سختگیرانه پیروی میکند که شامل لیستی از زنجیرهها (همراه با شناسهها، بازههای دقیق متنی و یک نماینده استاندارد) و در نهایت متن اصلاحشده (
resolved_text) است. - تنظیمات قطعی: مقدار دما (Temperature) روی ۰.۱ تنظیم شده است تا اطمینان حاصل شود که خروجی در اجراهای مختلف یکسان و سازگار باقی میماند.
- پاکسازی دفاعی: اسکریپت شامل منطقی است که هرگونه علامتهای کد Markdown یا تگهای "json" را که ممکن است مدل دور پاسخ خود بپیچد، حذف و پاکسازی میکند.
- زیرساخت API: این ابزار از مدل قیمتگذاری ثابت به ازای هر درخواست (Flat per-request) در Oxlo.ai استفاده میکند که مانع از جهش ناگهانی هزینهها هنگام پردازش قطعات طولانی متن میشود. این رویکرد در راستای حذف هزینههای متغیر پنجره زمینه در مدلهای زبانی است تا پیشبینی مالی برای توسعهدهندگان سادهتر شود.
فرآیند حل ارجاعات
اسکریپت، مشخصترین اشاره در یک زنجیره را به عنوان «نماینده استاندارد» شناسایی میکند. برای مثال، در جمله «سارا به فروشگاه رفت. او شیر خرید»، ابزار تشخیص میدهد که «سارا» موجودیت اصلی است و متن را به «سارا به فروشگاه رفت. سارا شیر خرید» تغییر میدهد.
برای اینکه این ابزار روی فایلهای واقعی قابل استفاده باشد، دارای یک رابط خط فرمان (CLI) است که با استفاده از کتابخانه argparse پیاده شده است. این قابلیت به اسکریپت اجازه میدهد تا ورودی را یا از یک فایل متنی مشخص و یا از stdin بخواند و نتایج را به صورت JSON زیبا (pretty-printed) چاپ کند.
این تغییر رویکرد، حل ارجاعات را از کتابخانههای تخصصی، سنگین و پیچیده NLP به مدلهای زبانی عمومی (LLM) منتقل میکند. با تبدیل پرامپت سیستمی به یک فایل پیکربندی، توسعهدهندگان میتوانند قوانین حل ارجاع — مانند ایجاد زنجیرههای مجزا برای اشارههای مبهم — را بدون تغییر در منطق پایتون اصلاح کنند. این امر باعث میشود خط لوله برای انواع مختلف اسناد، از قراردادهای حقوقی گرفته تا متون پزشکی، بسیار سازگار و انعطافپذیر باشد. این انعطافپذیری مشابه رویکرد اتوماسیون طبقهبندی اسناد در Oxlo.ai است که نیاز به زیرساختهای پیچیده محلی را از بین میبرد.
برای کاربر نهایی، مزیت اصلی حذف «اضطراب توکن» است. در مدلهای سنتی، قیمتگذاری بر اساس توکن (Token) — تکههای کوچکی از متن شبیه برشهای کیک — باعث میشد پاکسازی اسناد طولانی به یک قمار مالی تبدیل شود. اما قیمتگذاری ثابت، پیشفرضهای اقتصادی را تغییر داده و پردازش دستهای پوشههای حجیم از متون را بدون ترس از صورتحسابهای غیرمنتظره ممکن میکند.
توسعهدهندگان همچنین میتوانند با افزودن یک فلگ مدل، بین Llama 3.3 70B و مدل Kimi-k2.6 برای اسناد چندزبانه جابهجا شوند، زیرا هر دو مدل تحت یک نقطه اتصال (Endpoint) و SDK واحد در Oxlo.ai میزبانی میشوند.
برای مقیاسپذیری بیشتر، میتوانید این اسکریپت را در یک حلقه شل (Shell Loop) برای پردازش کل دایرکتوری قرار دهید یا آن را در یک خط لوله بزرگتر تولید بازیابیافزا (RAG) ادغام کنید تا کیفیت استناد و زمینهسازی اطلاعات بهبود یابد. در واقع، این ادغام به ما کمک میکند تا مرز بین استدلال مدلهای زبانی و بازنمایی دادهها در سیستمهای RAG را بهتر درک کنیم.
گام بعدی شما
- اگر با اسناد طولانی سر و کار دارید، مدل قیمتگذاری Flat را برای کاهش ریسک مالی جایگزین مدلهای Token-based کنید.
- برای بهبود دقت در متون تخصصی، پرامپت سیستمی بر اساس نوع سند (مثلاً پزشکی یا حقوقی) شخصیسازی کنید.
- این ابزار را به عنوان پیشپردازشگر در یک خط لوله RAG — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب را باز میکند — قرار دهید تا کیفیت بازیابی اطلاعات افزایش یابد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو