پرش به محتوای اصلی
پرش به محتوای مقاله

تضاد مهندسان ارشد: استفادهٔ پنهانی از هوش مصنوعی در عین نقد «زباله‌های دیجیتال»

·۲۵ تیر ۱۴۰۵۱۶ دقیقه مطالعه
منتقدان مدل‌های زبانی بزرگ حق دارند. با این حال من همچنان از آن‌ها استفاده می‌کنم.
منتقدان مدل‌های زبانی بزرگ حق دارند. با این حال من همچنان از آن‌ها استفاده می‌کنم.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی متدهای عملیاتی مانند «حلقه رالف ویگوم» و «Grill-me» برای تبدیل LLM از یک دستیار موافق به یک منتقد سخت‌گیر، تا از تولید محتوای بی‌کیفیت (Slop) جلوگیری شود.

تصور کنید مهندسی هستید که در هر جلسه عمومی از تخریب محیط‌زیست و سقوط اخلاقی توسط هوش مصنوعی می‌گوید، اما در همان لحظه روی لپ‌تاپش بازهٔ کدنویسی Claude را باز دارد. این تضاد، وضعیت فعلی لایه‌ی ارشد برنامه‌نویسان است که استدلال می‌کنند تنها راه اجتناب از «زباله‌های دیجیتال» (AI Slop)، این است که با مدل‌های زبانی بزرگ (LLM) نه به عنوان نویسنده، بلکه به عنوان «تقویت‌کننده‌های تفکر با سرعت بالا» برخورد کنند. این رویکرد نشان‌دهنده شکافی رو به رشد است؛ جایی که مهندسان ارشد در فضای عمومی از هوش مصنوعی انتقاد می‌کنند، اما در خلوت خود برای افزایش فوق‌العاده‌ی خروجی‌هایشان به آن متکی هستند.

این تنش در کنفرانس Local-First در برلین (۱۳ ژوئیه ۲۰۲۶) کاملاً ملموس بود. شرکت‌کنندگان برای سخنرانانی که اخلاقیات مدل‌های زبانی بزرگ — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن جواب می‌دهد — را درهم می‌شکستند، کفشان را می‌زدند، اما همزمان بسیاری از همان افراد در حال استفاده از Claude Code روی لپ‌تاپ‌هایشان بودند. این ناهماهنگی نشان‌دهنده‌ی تغییری در تجربه توسعه‌دهندگان است: ابزارها اکنون چنان مفید شده‌اند که حتی برای کسانی که تأثیرات سیستمیک آن‌ها را نفرت‌انگیز می‌دانند، نادیده گرفتنشان غیرممکن است.

همان‌طور که در تحلیل قبلی ما درباره‌ی چالش‌های ردیابی استنادها در Scrapeless اشاره کردیم، بحران فعلی صنعت از دقت فنی فراتر رفته و به مسئلهٔ حفظ اعتماد و اعتبار انسانی در اقیانوسی از داده‌های تولیدشده توسط ماشین تبدیل شده است.

زمینه‌ی این تضاد

محیط کنفرانس تضاد شدیدی را آشکار کرد. آرمین روناچر — خالق Flask و عضو قدیمی تیم Sentry — سخنرانی ویژه‌ای درباره ساخت موجودات ماشینی ارائه داد. روناچر اخیراً شرکت Earendil را تأسیس کرده است که محصول آن Pi.dev است؛ ابزاری که به عنوان یک «هارنس عامل کدنویسی متن‌باز» توصیف می‌شود.

روناچر با وجود اینکه ابزارهایی برای تسهیل ادغام هوش مصنوعی می‌سازد، در یک جلسه پرسش و پاسخ در دیسکورد افشا کرد که تیمش تقریباً تمام درخواست‌های ادغام (PR) و مسائل (Issues) ارسالی را به‌صورت خودکار می‌بندند. او تأکید کرد که اگرچه هنوز «جرقه‌های انسانی» در کدها دیده می‌شود، اما سیل مشارکت‌های تولیدشده توسط هوش مصنوعی دیگر ناپایدار و غیرقابل مدیریت است. طنز ماجرا اینجاست که در صفحهٔ معرفی Earendil آمده است: «در دنیایی که به سمت هوش مصنوعی می‌تازد، ما باور داریم انسان‌ها بهترین عامل‌ها هستند».

این تضاد به مخاطبان نیز سرایت کرده بود. حتی کسانی که فعالانه در حین سخنرانی‌ها از Claude Code استفاده می‌کردند، جزو افرادی بودند که وقتی سخنرانان دیدگاه‌های انتقادی خود را درباره LLMها بیان می‌کردند، «تشویق‌های گسترده‌ای» می‌کردند. این نشان‌دهنده احساس تسکینی مشترک در میان توسعه‌دهندگانی است که میان کاربرد حرفه‌ای و نگرانی‌های اخلاقی یا سیستمیک خود دچار تضاد هستند.

ریسک‌های سیستمیک و اخلاقی

منتقدان مدل‌های زبانی به چندین نگرانی معتبر اشاره می‌کنند که نویسنده نیز آن‌ها را می‌پذیرد. این بحران‌ها تنها فنی نیستند، بلکه ابعادی محیطی و مالی دارند:

  • کپی‌رایت و اخلاق: مدل‌ها روی حجم عظیمی از مواد دارای حق چاپ (Copyrighted) آموزش دیده‌اند که سؤالات اخلاقی عمیقی را در مورد مالکیت معنوی ایجاد می‌کند.
  • تخریب محیط‌زیست: نیازهای انرژی برای آموزش و استنتاج (Inference) — یعنی لحظه‌ای که مدل واقعاً جواب تولید می‌کند، شبیه خودِ آشپزی و نه دوره‌ی آموزش آشپز — برای سیاره زمین مرگبار است.
  • حباب اقتصادی: بسیاری چرخهٔ مالی بین انویدیا، OpenAI و جابه‌جایی پول میان آن‌ها را حبابی می‌بینند که مقدر است روزی بترکد.
  • همگرا شدن ایدئولوژیک: مدل‌ها تمایل دارند افکار اکثریت داده‌های آموزشی یا باورهای سیاسی سازندگانشان را به‌صورت نامحسوس تزریق کنند. این وضعیت یک حلقه بازخورد ایجاد می‌کند که در آن نظرات انسانی به‌تدریج با سوگیری‌های مدل یکی می‌شود؛ درست مثل گروهی از دوستان که همگی به مرور زمان دایرهٔ لغات عجیب یکی از اعضای گروه را می‌پذیرند.

بحران اعتماد در دنیای متن‌باز

نرم‌افزارهای متن‌باز (OSS) با بحران اعتبار روبرو هستند. حجم بالای مشارکت‌های کم‌تلاش باعث شده تا نگهداران (Maintainers) نتوانند تفاوت بین تلاش واقعی یک انسان و یک ربات خودکار را تشخیص دهند. آن «بنیان» که پیش‌تر وجود داشت — یعنی این واقعیت که یک PR مناسب نیازمند زمان و تلاش انسانی بود — اکنون ناپدید شده است.

  • رد خودکار: پروژه‌هایی مثل Zig و Gentoo از پیش پذیرش PRهای تولیدشده توسط هوش مصنوعی را رد کرده‌اند، هرچند نگهداران اعتراف می‌کنند که اثبات اینکه یک PR توسط AI تولید شده، دشوار است. این تغییر در نحوه مدیریت کدها با دیدگاه خالق Redis هم‌سو است که معتقد است مهندسان باید به‌جای بررسی خط‌به‌خط، بر کنترل ایده‌ها تمرکز کنند.
  • شکاف اعتماد: از آنجا که کاربران می‌توانند به سادگی حساب‌های جدید گیت‌هاب بسازند و مدل‌های زبانی (مانند یک ماشین OpenClaw) را رها کنند، نگهداران دیگر نمی‌توانند اعتماد کنند که یک مشارکت‌کننده ساعت‌ها روی یک مشکل تحقیق کرده است. اگر راه‌هایی برای بازگرداندن اعتماد پیدا نشود، این روند می‌تواند منجر به مرگ نرم‌افزارهای متن‌باز شود.
  • راه‌حل‌های احتمالی: برخی پیشنهاد می‌کنند که اعتماد تنها از طریق پذیرش تعداد محدودی از مشارکت‌کنندگان تأییدشده که در ملاقات‌های حضوری (Meetups) با یکدیگر دیداره‌اند، بازگردد.

معمای مهندسان جونیور

استفاده از LLMها خط لولهٔ منتورینگ (راهنمایی) برنامه‌نویسان تازه‌کار را به دو روش خاص تغییر داده است:

اول، تلاش‌ها دیگر قابل راستی‌آزمایی نیستند. یک مهندس ارشد نمی‌تواند تشخیص دهد که آیا یک جونیور ۱۰ ساعت برای درک یک مفهوم کلنجار رفته یا ۱۰ دقیقه با متد Vibe Coding (کدنویسی بر اساس حس و حال) و کمک مدل، جواب را پیدا کرده است. غیرممکن است بدانیم آیا توسعه‌دهنده واقعاً فاقد بینش است یا فقط با کمک یک ابزار در حال تکرار سریع (Iteration) است.

دوم، وظایف تکراری و سطح پایین که زمانی زمین تمرین جونیورها بود — همان «کارهای کسل‌کننده» که ارشدها برای کمک به رشد جونیور بازبینی می‌کردند — اکنون به هوش مصنوعی سپرده شده است. در نتیجه، انگیزه‌ی ارشدها برای استخدام یا آموزش انسان‌های جدید کاهش یافته، زیرا بهره‌وری حاصل از یک LLM بر سرمایه‌گذاری بلندمدت روی یک انسان می‌چربد.

شکنندگی ژئوپلیتیکی و حاکمیت

اتکا به مدل‌های بسته، ریسک‌های استراتژیک شدیدی دارد. در ۱۲ ژوئن ۲۰۲۶، یک دستورالعمل کنترل صادرات آمریکا باعث شد Anthropic به‌طور ناگهانی دسترسی به مدل‌های Fable 5 و Mythos 5 را برای تمام کاربران غیرآمریکایی قطع کند.

منتقدان مدل‌های زبانی بزرگ حق دارند. با این حال من همچنان از آن‌ها استفاده می‌کنم.

این اتفاق ناپایداری تکیه بر چند غول شرکتی را برجسته می‌کند. مارتین کلمن در سخنرانی خود اشاره کرد که اگرچه احتمال درگیری اروپا و آمریکا کم است، اما سال پیش این احتمال صفر بود.

برای مقابله با این وضعیت، موجی به سمت مدل‌های «وزن‌های باز» (Open Weights) — یعنی مدل‌هایی که دستور پخت آن‌ها علناً منتشر شده — ایجاد شده تا روی سخت‌افزار شخصی اجرا شوند. این گذار به سخت‌افزارهای محلی، پاسخی به محدودیت‌های مدل‌های ابری است، همان‌طور که برخی توسعه‌دهندگان برای عبور از محدودیت‌های NDA، هزینه‌های سنگینی را برای تجهیزات سخت‌افزار محلی پذیرفته‌اند. این کار تضمین می‌کند که برنامه‌نویسان مستقل از تصمیمات دولت‌ها یا ترکیدن حباب اقتصادی AI باشند. مدل‌های محلی مانع از دست رفتن یک‌شبه ابزارها می‌شوند و به عنوان سدی در برابر افزایش قیمت‌های تامین‌کنندگان بزرگ عمل می‌کنند. سخنرانی‌های کنفرانس Local-First به‌طور ویژه بر اهمیت جدی گرفتن مدل‌های محلی تأکید داشتند.

هزینهٔ بالای کیفیت

استفاده حرفه‌ای از این ابزارها گران و نیازمند توکن‌های زیاد است. یک مهندس گزارش داد که تنها در ژوئن ۲۰۲۶، نزدیک به ۱۰ هزار دلار برای توکن‌ها هزینه کرده است.

منتقدان مدل‌های زبانی بزرگ حق دارند؛ اما من همچنان از آن‌ها استفاده می‌کنم.

گزارش هزینه‌های او نشان می‌دهد که ۵,۰۴۲ دلار برای مدل Opus 4.8 و ۴,۱۷۹ دلار برای Fable 5 پرداخت کرده و مبالغ کمتری را صرف Sonnet 4.6 نموده است. استدلال او این است که اگر هدف تولید محتوای کمتر اما با کیفیت بسیار بالاتر باشد (به جای تولید حجم زیادی از محتوای متوسط)، این هزینه ضروری است.

او برای مدیریت این هزینه‌ها، استفاده از Fable را گزینشی کرد و برای اجرای صرف کد، از مدل‌های ارزان‌تری مثل GLM 5.2 از طریق OpenRouter استفاده کرد. او معتقد است صرف مقادیر بسیار زیاد توکن برای آماده‌سازی تنها چند جمله برای مخاطب انسانی، در واقع یک استفاده با ارزش بالا از این تکنولوژی است.

مکانیسم‌های مبارزه با توهم

برای جلوگیری از «چاپلوسی» مدل‌ها — یعنی تمایل آن‌ها به پیشروی در کار بدون تأیید درک کامل — نویسنده از الگوهای فنی خاص زیر استفاده می‌کند:

  • مهارت Grill-me: این تکنیک که از مت پلی‌کاک اقتباس شده، مدل را مجبور می‌کند کاربر را به‌شدت بازجویی کند. پرامپت دقیق این است: «من را بی‌وقفه درباره هر جنبه از این موضوع بازجویی کن تا به یک درک مشترک برسیم. هر شاخه از درخت تصمیم را طی کن و وابستگی‌ها را یکی‌یکی حل کن. برای هر سوال، پاسخ پیشنهادی خودت را ارائه بده. سوالات را یکی‌یکی بپرس». در این روش، مدل حق ندارد چند سوال را همزمان بپرسد و باید برای یافتن حقایق به جای پرسش از انسان، سیستم فایل یا ابزارها را جستجو کند، هرچند تصمیم نهایی با کاربر است.
  • حلقه رالف ویگوم (Ralph Wiggum Loop): که به عنوان «اولترا-کد» کلود نیز شناخته می‌شود. در این روش، مدل را در یک نقشه یا کد قفل می‌کنند و سپس چندین عامل (Agent) جدید با حافظه پاک می‌سازند که تنها وظیفه‌شان تخریب و نقد شدید کانتکست اصلی است. روند کار تنها زمانی متوقف می‌شود که این عامل‌ها مجبور شوند برای پیدا کردن نقص، توهم بزنند (چون هیچ نقص واقعی باقی نمانده باشد).
  • کاوش شهودی: بر اساس تکنیک آنسلم ایک‌هاف، در این روش به یک عامل «کور» اجازه می‌دهند API یا تجربه کاربری (UX) مورد انتظارش را پیش از دیدن طراحی واقعی حدس بزند. اگر حدس مدل با قصد طراح یکی باشد، یعنی طراحی بصری و شهودی است. این یک تست ارزان برای بررسی تطابق طراحی با انتظارات عمومی انسان‌هاست.

منتقدان مدل‌های زبانی بزرگ حق دارند؛ با این حال من از آن‌ها استفاده می‌کنم.

پالایش خط تولید خروجی

برای اینکه نتیجه نهایی تبدیل به «زباله دیجیتال» نشود، استراتژی‌های زیر به‌کار می‌روند:

  • پیشنهاد بیس‌کمپ (Basecamp Pitch): هر تسک با یک شرح سه جمله‌ای شروع می‌شود که بر این سه محور تمرکز دارد: «مشکل چیست»، «چه چیزی را تحویل می‌دهیم» و «چه چیزی را تحویل نمی‌دهیم». این کار انسان را مجبور می‌کند که واقعاً قصد اصلی را بخواند و تأیید کند.
  • پارادوکس بازبینی: همان‌طور که یک کد ۱۰۰۰ خطی معمولاً با یک «اوکی است» (LGTM) تنبل رد می‌شود، اما یک کد ۱۰۰ خطی ۱۵ کامنت می‌گیرد، شرح‌های کوتاه و concise بازبینی دقیق‌تری می‌گیرند. نویسنده اکثر خروجی‌ها را سریع می‌بیند اما این سه جمله کلیدی را با شدت تمام بازبینی می‌کند.
  • نظم در PR: تلاش زیادی روی توضیحات PR و افزودن اسکرین‌شات برای اثبات عملکرد کد می‌شود تا اثرات کلیشه‌ای و زباله‌های تولید شده توسط هوش مصنوعی حذف گردد. نویسنده اشاره می‌کند که برای PRهای کم‌اهمیت، گاهی اجازه می‌دهد LLM در نوشتن توضیحات «پیروز شود»، اما به‌طور کلی کنترل سخت‌گیرانه‌ای دارد.

فیلتر اعتبار

در نهایت، تفاوت بین زباله دیجیتال و نوشته خوب در این است که آیا انسانی واقعاً پشت آن فکر کرده است یا خیر. یک تست ساده برای اعتبار وجود دارد: آیا حاضر هستید این متن را بدون شرم، کلمه به کلمه جلوی یک جمع بخوانید؟

اگر مجبورید جمله‌ای را «توضیح دهید که منظورش چه بوده»، آن متن زباله است. اگر متن دقیق است و نیاز به عذرخواهی ندارد، یک تقویت موفق از تفکر انسانی است. اما این سطح از کیفیت نیازمند تخصص کاربر است؛ شما نمی‌توانید کاری را به LLM بسپرید مگر اینکه خودتان بدانید «یک نتیجه خوب» چیست.

  • حوزه‌های با قطعیت بالا: در جاهایی که نتایج باینری هستند (مثلاً کد یا کامپایل می‌شود یا نمی‌شود، یا یک باینری پچ می‌شود یا دستگاه می‌سوزد)، کاربران می‌توانند از LLMها برای یادگیری و مهندسی معکوس پروتکل‌ها (مثلاً با Opus 4.6) استفاده کنند زیرا بازخورد فوری است.
  • حوزه‌های نظری: در برنامه‌نویسی، مدل‌ها تمایل دارند «محبوب‌ترین» تکنیک را پیشنهاد دهند، نه لزوماً «بهترین». این در یک بحث تیمی مشاهده شد که همکاران کدی را «زباله AI» نامیدند، اما بعداً متوجه شدند که در واقع فقط از TDD (توسعه آزمون‌محور) متنفرند. هوش مصنوعی صرفاً نظر اکثریت داده‌های آموزشی را تقویت کرده بود.

این تحول ثابت می‌کند که هوش مصنوعی جایگزین تفکر نمی‌شود، بلکه آنچه در ذهن کاربر است را تقویت می‌کند. خواه نتیجه نبوغ باشد یا مزخرفات تقویت‌شده، همه‌چیز به انسانی بستگی دارد که فرمان را گرفته است. برای اینکه ببینید آیا پروژه فعلی شما به «زباله AI» تبدیل شده یا خیر، سعی کنید پرامپت Grill-me را روی آخرین مستندات فنی خود اجرا کنید و ببینید مدل چند پیش‌فرض غلط را در منطق شما تخریب می‌کند.

گام بعدی شما

  • پرامپت «Grill-me» را روی آخرین مستندات فنی خود اجرا کنید تا ببینید مدل چه پیش‌فرض‌های غلطی را در منطق شما پیدا می‌کند.
  • برای کارهای حساس، از روش «عامل‌های نقدگر» (Sub-agents) استفاده کنید تا نقاط کور کدتان را شناسایی کنند.
  • شرح تسک‌های خود را به فرمول ۳ جمله‌ای (مشکل/تحویل/عدم‌تحویل) محدود کنید تا کنترل کیفیت را بازیابید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این وضعیت نشان می‌دهد که استانداردهای کیفیت در صنعت نرم‌افزار در حال تغییر است و اعتبار متخصصان اکنون با توانایی آن‌ها در مدیریت و پالایش خروجی‌های AI تعریف می‌شود. تکیه بر تخصص انسانی برای تشخیص «زباله» از «کد بهینه»، تنها سد دفاعی باقی‌مانده در برابر سقوط کیفیت نرم‌افزارهای متن‌باز است.

تأثیر برای ایران

به دلیل محدودیت‌های دسترسی به مدل‌های پیشرفته مثل Fable 5 و Claude برای کاربران ایرانی، توسعه‌دهندگان داخلی بیشتر به مدل‌های متن‌باز (Open Weights) متکی هستند که دقیقا با استراتژی ذکر شده در مقاله برای حفظ استقلال فنی هم‌سو است.

·نگاه ما
تحریریه دات‌هوش

پذیرش ابزارهای AI توسط مهندسان ارشد، علیرغم نقد اخلاقی آن‌ها، نشان‌دهنده یک «تسلیم کاربردی» است. نکته کلیدی این است که LLMها دیگر به عنوان جایگزین نویسنده، بلکه به عنوان تقویت‌کننده سرعت تفکر (Thinking Amplifier) به کار می‌روند. این یعنی برتری در عصر جدید نه در توانایی تولید کد، بلکه در توانایی «بازبینی و فیلتر کردن» نتایج ماشین است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.