پرش به محتوای اصلی
پرش به محتوای مقاله

استاندارد هوانوردی ASD-STE100 نرخ خطاهای نگارشی هوش مصنوعی را ۷۲.۹٪ کاهش داد

·۹ مرداد ۱۴۰۵۶ دقیقه مطالعه۳ بازدید
مهارت عامل: نوشتن مستندات فنی ساده‌شده توسط مدل‌های زبانی بزرگ — بدون محتوای بی‌کیفیت هوش مصنوعی
مهارت عامل: نوشتن مستندات فنی ساده‌شده توسط مدل‌های زبانی بزرگ — بدون محتوای بی‌کیفیت هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک استاندارد صنعتی ۴۰ ساله (هوانوردی) به یک Agent Skill قابل نصب؛ انتقال از «راهنمایی مدل برای شفافیت» به «اجبار مدل به رعایت قوانین عددی و ساختاری STE».

اگر در حال حاضر برای تولید مستندات فنی روی هوش مصنوعی حساب می‌کنید، احتمالاً با متونی مواجه هستید که بیش از حد طولانی و مبهم‌اند. اما حالا ابزاری آمده است که این «پرگویی» مدل‌ها را با قوانین سخت‌گیرانه صنعت هوافضا جایگزین می‌کند.

به گزارش گیت‌هاب، ابزاری به نام SimpleEnglish مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — را مجبور می‌کند تا طبق استاندارد ASD-STE100 بنویسند. این رویکرد، درخواست‌های مبهمی مثل «شفاف بنویس» را با یک مشخصه فنی ۴۰ ساله جایگزین کرده تا دستورالعمل‌ها به‌گونه‌ای نوشته شوند که هرگز نتوان آن‌ها را اشتباه خواند. این مهارت باعث کاهش ۷۲.۹ درصدی تخلفات نگارشی در هر ۱۰۰ کلمه در چندین مدل مختلف شده است.

نگارش فنی مدت‌هاست با مشکل «آشغال‌های هوش مصنوعی» (AI Slop) دست‌وپنجه نرم می‌کند؛ یعنی میل مدل‌ها به تولید متونی حاشیه‎‌رون، تکراری و محتاطانه. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی آسیب‌پذیری مدل‌ها در برابر جعل زنجیره تفکر (Chain-of-Thought Forgery) در تحقیقات ICML دیدیم، مشکل دقت زبانی یک مانع عملی جداگانه برای مستندات سطح تولید است. برای مکانیکی که در یک hangar پرصدا کار می‌کند یا برنامه‌نویسی که ساعت ۲ صبح کد می‌زند، یک دستور مبهم فقط یک مزاحمت نیست، بلکه یک نقطه شکست است. این چالش با نرخ شکست ۶۳.۸ درصدی عامل‌های پیشرو در اجرای سیاست‌های سازمانی هم‌سو است که نشان می‌دهد حتی مدل‌های پیشرفته در رعایت دقیق محدودیت‌های ساختاری دچار مشکل هستند.

در ۳۰ ژوئیه ۲۰۲۶، مخزن SimpleEnglish منتشر شد تا نگارش فنی را به‌جای یک انتخاب سبک‌شناختی، به عنوان یک «مشخصه فنی» (Specification) تعریف کند. این مهارت بر اساس استاندارد ASD-STE100 ساخته شده است؛ زبانی کنترل‌شده که از سال ۱۹۸۳ در صنایع هوافضا استفاده می‌شود. طبق مستندات این پروژه، این استاندارد بر اساس قوانین شماره‌گذاری‌شده و قابل تست است که به‌طور خاص نقاط ضعف زبانی مدل‌های مدرن LLM را هدف قرار می‌دهد، نه اینکه صرفاً بر اساس «حس و حال» کلی باشد. این رویکرد در واقع پیاده‌سازی عملی از استاندارد SKILL.md است که مهندسی قابلیت‌ها را جایگزین پرامپت‌های شکننده کرد تا توابع زبانی به شکلی توزیع‌پذیر و قابل پیش‌بینی شوند.

زمینه و ریشه‌ها

استاندارد STE توسط متخصصانی خلق شد که خوانندگانشان در صورت مواجهه با یک جمله مبهم، با خطرات جانی روبرو می‌شدند. به همین دلیل، این ابزار شفافیت مطلق را به «لحن برند» ترجیح می‌دهد. این پروژه با متد TDD (توسعه‌محور تست) و دقیقاً بر اساس متن اصلی ویرایش ۹ (ژانویه ۲۰۲۵) توسعه یافته است، نه بر اساس خلاصه‌های غیرقابل‌اعتماد وبلاگ‌ها.

این تفکیک حیاتی است، زیرا بسیاری از منابع دست‌دوم آنلاین، قوانین مربوط به افعال وجهی (Modals) را اشتباه گزارش می‌کنند. برای مثال، این ابزار به‌درستی تأیید می‌کند که کلمات «can» و «will» کلمات مورد تأیید هستند؛ حقیقتی که مستقیماً از PDF رسمی استخراج شده است. در مقابل، عامل‌های پایه (Baseline Agents) معمولاً قوانین اشتباهی را توهم می‌کنند یا شماره قوانین را به غلط می‌سازند؛ مثلاً ادعا می‌کنند «قانون ۳.۱ مربوط به جملات کوتاه است»، در حالی که قانون ۳.۱ واقعی در واقع مربوط به فرم‌های فعل است.

سازوکار ابزار

این مهارت ۵۳ قانون شماره‌گذاری‌شده در ۹ بخش را پیاده می‌کند. بر اساس مستندات گیت‌هاب، محدودیت‌های کلیدی زیر باعث نابودی حشو در هوش مصنوعی می‌شوند:

  • طول جمله: دستورالعمل‌ها به ۲۰ کلمه و توضیحات به ۲۵ کلمه محدود شده‌اند تا جملات طولانی و پیچیده (Run-on sentences) به‌طور کامل حذف شوند.
  • یک کلمه، یک معنا: استفاده از «رولت» جایگزینی کلمات مشابه مثل check، verify، confirm و validate ممنوع است. یک کلمه باید در کل سند تنها یک معنای واحد داشته باشد.
  • کنترل زمان افعال: فقط زمان‌های ساده مجاز هستند؛ عباراتی مثل "has been updated" به اجبار به "we updated" تغییر می‌کنند. همچنین فرم‌های verb-ing و جملات پیرو مانند "making it easy to..." ممنوع شده‌اند.
  • وجه فعال: عبارات محتاطانه‌ای مثل "it should be noted that" حذف شده و کلمات should، would، may و might ممنوع شده‌اند. در این ساختار، فقط can، will و must باقی می‌مانند.
  • منطق فرمان: شرایط باید قبل از دستور بیایند. این کار از ایجاد «شرایط trailing» (مثلاً: «...اگر پرچم فعال بود») جلوگیری می‌کند که ممکن است خواننده آن‌ها را خیلی دیر بخواند و دستور را زودتر اجرا کند.
  • ساختار دانه‌ای: هر جمله فقط باید یک دستور را منتقل کند. با این حال، برای جلوگیری از تبدیل شدن متن به سبک تلگرافی یا بیش از حد کوتاه، حروف تعریف و کلمه "that" حفظ شده‌اند.

بنچمارک‌ها و عملکرد

توسعه‌دهنده اثرگذاری این ابزار را در ۹۶ دور اجرا، با استفاده از ۶ مدل مختلف Claude در ۸ وظیفه نگارشی اندازه گرفت. نتایج منتشر شده در بخش ارزیابی‌های مخزن، کاهش مداوم توکن‌های خروجی را در تمام ۶ مدل نشان می‌دهد. میانگین طول جملات از ۱۱.۲ به ۹.۷ کلمه کاهش یافت و کلمه کلیشه‌ای "seamlessly" در ۰٪ خروجی‌ها ظاهر شد.

عملکرد مدل‌های مختلف به شرح زیر بود:

  • claude-opus-4-6 و claude-opus-4-7: بیشترین کاهش تخلفات با ۸۲٪.
  • claude-opus-4-5: کاهش ۷۸ درصدی.
  • claude-sonnet-5: کاهش ۸۰ درصدی.
  • claude-sonnet-4-6: کاهش ۷۵ درصدی.
  • claude-opus-4-8: کاهش ۴۱ درصدی.

این نتایج با استفاده از یک linter قطعی مبتنی بر regex تأیید شده‌اند. متدولوژی کامل و لیست صادقانه محدودیت‌ها (Caveats) در فایل evals/results/RESULTS.md موجود است و تست‌ها را می‌توان با اجرای دستور python3 evals/run_bench.py از طریق Claude Code CLI بازتولید کرد.

استقرار و سازگاری

SimpleEnglish یک ابزار سبک و بدون وابستگی (dependency-free) تحت لایسنس MIT است. این ابزار با استاندارد Agent Skills سازگار است و در محیط‌هایی مثل Claude Code، Cursor، VS Code Copilot، OpenAI Codex، Gemini CLI، Goose، OpenCode و حدود ۲۵ ابزار دیگر قابل اجراست. این ابزار نمونه‌ای از کاربرد عملی قابلیت‌های توزیع‌پذیر است که نشان می‌دهد ساختار دایرکتوری‌محور چگونه اتوماسیون کد را در Claude Code متحول می‌کند.

کاربران می‌توانند با دستور npx skills add AminBlg/SimpleEnglish آن را نصب کنند، که به CLI اجازه می‌دهد عامل‌ها را شناسایی کرده و برای موارد منتخب نصب کند. برای کسانی که ترجیح می‌دهند قبل از نصب، ابزار را تست کنند، دستور npx skills use AminBlg/SimpleEnglish@simple-english در دسترس است.

برای کاربرانی که دسترسی به ترمینال ندارند، می‌توان فایل SKILL.md را مستقیماً در طرح‌های پولی claude.ai از طریق مسیر Settings $\rightarrow$ Capabilities (Code Execution) $\rightarrow$ Customize $\rightarrow$ Skills آپلود کرد. برای ChatGPT و Gemini نیز می‌توان منطق ابزار را با کپی کردن بلوک موجود در prompts/system-prompt.md در دستورالعمل‌های سفارشی (Custom Instructions) یا یک 'Gem' سفارشی منتقل کرد. همچنین یک نسخه ۶۰ توکنی برای کاربرانی که محدودیت شدید بودجه دارند، وجود دارد.

فراتر از راهنما

اگرچه این ابزار برای مستندات طراحی شده، اما در فایل use-cases.md انطباق‌های خاصی برای دیگر خروجی‌های فنی حساس ارائه داده است:

  • پیام‌های خطا: ترتیب جریان را به «چه اتفاق افتاد» $\rightarrow$ «چرا» $\rightarrow$ «چه باید کرد» تغییر می‌دهد. این کار پیام‌های مبهمی مثل "Oops! Something went wrong" را با دلایل شکست دقیق جایگزین می‌کند (مثلاً: "Connection to the database failed: the password for user app was not correct").
  • دفترچه‌های عملیاتی (Runbooks): خروجی AI را با ماهیت دفترچه‌های تعمیرات و نگهداری هم‌تراز می‌کند که در واقع خانه اصلی استاندارد STE است.
  • گزارش‌های حادثه: با استفاده از زمان گذشته ساده، عبارات غیرفعال و اداری رایج در گزارش‌ها را حذف می‌کند (مثلاً جایگزینی "we have identified an issue" با یک روایت مستقیم مانند: "A deploy at 14:00 removed the cache warmup step").
  • یادداشت‌های انتشار (Release Notes): در تغییرات ساختاری (Breaking Changes)، مدل را مجبور می‌کند ابتدا فرمان و سپس ریسک را ذکر کند.
  • آماده‌سازی برای ترجمه: متن را برای غیرانگلیسی‌زبانان ساده می‌کند تا بومی‌سازی (Localization) ارزان‌تر و دقیق‌تر انجام شود.

این ابزار به‌طور صریح می‌داند که متون مارکتینگ، لحن وبلاگی و نگارش برند خارج از محدوده STE هستند و این محدودیت‌ها را روی آن فرمت‌ها اعمال نمی‌کند.

این تغییر، فرض بنیادی نگارش فنی با کمک هوش مصنوعی را دگرگون می‌کند: هدف از «خواندنی بودن» به «کسب گواهینامه» (Certifiable) تغییر می‌یابد. با تبدیل پرامپت سیستمی به یک رویه برای خواننده‌ای که نمی‌تواند سؤال بپرسد، تمام ابهامات منجر به خطای تولید حذف می‌شوند. اگرچه این ابزار رسماً توسط ASD تأیید نشده (چون ASD هیچ ابزاری را تأیید نمی‌کند)، اما چارچوبی عمل‌گرایانه از قوانین ساختاری و واژگان تخصصی فراهم می‌کند که مستندات شما را دقیقاً شبیه دفترچه‌های ایرباس می‌کند: تخت، خشک و غیرقابلِ اشتباه خواندن.

گام بعدی شما

  • اگر از Claude Code یا Cursor استفاده می‌کنید، ابزار را با دستور npx skills add تست کنید تا حجم توکن‌های مصرفی در مستندات را کاهش دهید.
  • پرامپت سیستمی موجود در مخزن را به «دستورالعمل‌های سفارشی» ChatGPT اضافه کنید تا لحن مدل از حالت «دستیار مودب» به «نویسنده فنی» تغییر کند.
  • پیام‌های خطای اپلیکیشن خود را با منطق «اتفاق $\rightarrow$ علت $\rightarrow$ راهکار» بازنویسی کنید تا نرخ تیکت‌های پشتیبانی کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با تکیه بر اعتبار استاندارد ASD-STE100، ریسک خطاهای عملیاتی ناشی از ابهام در مستندات فنی را به‌شدت کاهش می‌دهد. این تغییر، هزینه استنتاج را از طریق حذف توکن‌های اضافی (AI Slop) پایین می‌آورد و دقت را در محیط‌های حساس بالا می‌برد.

تأثیر برای ایران

برنامه‌نویسان ایرانی که برای شرکت‌های خارجی مستندات فنی می‌نویسند، می‌توانند با این ابزار کیفیت خروجی‌های خود را به استانداردهای جهانی (مانند Airbus) برسانند و خطاهای نگارشی را حذف کنند.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «ترجیحات سبکی» با «استانداردهای صنعتی سخت» در پرامپت‌ها، نقطه عطفی در کاهش توهمات زبانی است. این رویکرد نشان می‌دهد که برای رسیدن به خروجی‌های قابل‌اعتماد در محیط‌های عملیاتی، نباید به امید بهبود خودکار مدل‌ها نشست، بلکه باید «حصارها» (Guardrails) را بر اساس استانداردهای انسانی قدیمی اما دقیق بازتعریف کرد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.