پرش به محتوای اصلی
پرش به محتوای مقاله

چطور GLM 5.2 دقت حسابداران انسانی را با هزینه کمتر شبیه‌سازی کرد؟

·۱۸ تیر ۱۴۰۵۸ دقیقه مطالعه
GLM ۵.۲ تقریباً به دقت حسابدار انسانی با کمتر از ۱٪ هزینه
GLM ۵.۲ تقریباً به دقت حسابدار انسانی با کمتر از ۱٪ هزینه
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

به جای تکیه بر مدل‌های گران‌قیمت بسته، یک مدل وزن‌های‌باز توانست با دقت نزدیک به ۱۰۰٪ و هزینهٔ کمتر از ۱٪ انسان، یک فرآیند قانونی سخت‌گیرانه را مدیریت کند.

اگر امروز یک کسب‌وکار کوچک در بریتانیا هستید، احتمالاً سالانه هزاران دلار بابت حسابداری ساده می‌پردازید؛ اما حالا ابزاری آمده که این هزینه را تقریباً به صفر برساند. مدل GLM 5.2 ثابت کرد که می‌تواند با دقتی خیره‌کننده، وظایفی را انجام دهد که پیش از این حصری برای متخصصان انسانی بود.

به نقل از گزارش منتشر شده در ۹ جولای ۲۰۲۶ توسط toot-books.pages.dev، این مدل توانسته است اظهارنامه‌های مالیاتی مربوط به مالیات بر ارزش افزوده (VAT) را با هزینه‌ای کمتر از ۱٪ یک حسابدار انسانی آماده کند. در حالی که یک دفتردار سنتی برای هر فصل بین ۷۵۰ تا ۲۱۰۰ پوند (۱۰۰۰ تا ۲۸۰۰ دلار) دستمزد می‌گیرد، GLM 5.2 پردازش ۵۹ تراکنش تجاری را تنها با ۲.۷۳ دلار به پایان رساند. این تحول در کاهش هزینه‌های عملیاتی، به‌ویژه برای افرادی که با چالش‌های مالی مشابه دست‌وپنجه نرم می‌کنند، حیاتی است؛ چنان‌که پیش‌تر بررسی کردیم چگونه حسابداری دستی می‌تواند بخش قابل‌توجهی از درآمد هفتگی فریلنسرها را ببلعد.

برای درک این تحول، ابتدا باید بدانیم که برای شرکت‌های کوچک و متوسط (SME) در بریتانیا، رعایت قوانین VAT یک الزام قانونی سخت‌گیرانه است. کسب‌وکارهای ثبت‌شده برای VAT باید هر سه ماه یک‌بار اظهارنامه خود را تهیه و ارسال کنند. الزام قانونی این است که این ارسال حداکثر تا ۵ هفته پس از پایان فصل مالی صورت گیرد. هرگونه شکست در رعایت این ضرب-الاجل منجر به جریمه‌های سنگین مالی می‌شود. به همین دلیل، اکثر این کسب‌وکارها در حال حاضر برای اجتناب از این ریسک‌ها، کارهای تکراریِ ورود داده و طبقه‌بندی را به شرکت‌های حسابداری برون‌سپاری می‌کنند و این امر باعث ایجاد وابستگی پرهزینه‌ای به تخصص انسانی برای کارهای روتین شده است. همان‌طور که در تحلیل‌های پیشین ما درباره‌ی اتوماسیون جریان‌های کاری اشاره کردیم، این دقیقاً همان نقطه‌ای است که مدل‌های زبانی از «چت‌بات» به «عامل» تبدیل می‌شوند.

در این بنچمارک، مدل GLM 5.2 برای پردازش دفاتر مالیاتی شرکت Vineyard Finance در بازه اول سال (ژانویه تا مارس ۲۰۲۶) به کار گرفته شد. مدل در یک محیط کنترل‌شده (harness) حداقلی روی پلتفرم گوگل کلاود (GCP) اجرا شد و از طریق یک ابزار خط فرمان (CLI) داده‌ها را مستقیماً وارد نرم‌افزار حسابداری ابری کرد. برای تضمین نبود تقلب و جلوگیری از نشت داده‌ها، مدل از داده‌های مرجع (ground-truth) ایزوله شده بود، اگرچه برای انجام تحقیقات خاص، دسترسی به اینترنت داشت. این محیط تنها دو ابزار را در اختیار مدل قرار داد: ابزار bash برای اجرای دستورات و ابزار پایان جلسه (session termination) برای گزارش نهایی.

جزئیات زمینه و ساختار بنچمارک

داده‌های مرجع این آزمایش از طریق دفاتری تهیه شده بود که توسط انسان‌ها در محیط داخلی آماده شده بودند. این فرآیند انسانی شامل دو مرحله بود: یک نفر دفاتر را آماده می‌کرد و نفر دوم آن‌ها را بازبینی و تأیید می‌نمود. لازم به ذکر است که انسان‌ها محدوده وسیع‌تری از کار را نسبت به مدل انجام دادند؛ برای مثال، آن‌ها صندوق‌های ورودی ایمیل را برای یافتن فاکتورها جستجو کرده و از تأمین‌کنندگان درخواست مدارک می‌کردند.

برای شبیه‌سازی این شرایط، بنچمارک «یادداشت‌های کاربر» را برای مدل فراهم کرد تا زمینه‌هایی که از طریق گردش‌حساب بانکی یا رسیدها قابل استنباط نبود را درک کند. از بین ۵۹ تراکنش، تنها دو مورد نیاز به این یادداشت‌ها داشتند: «سهام مؤسسان» و «اجاره خودروی شخصی».

مدل برای هر تراکنش سه ورودی مشخص دریافت می‌کرد:
۱. یک خط از گردش‌حساب بانکی شامل شناسه (ID)، تاریخ، مبلغ، ارز، حساب (مثلاً Wise GBP) و شرح تراکنش.
۲. یک فایل PDF رسید. تمامی رسیدها PDFهای متنی بودند؛ از آنجا که نیاز به پردازش تصویر نبود، فقدان قابلیت بینایی (Vision) در GLM 5.2 به عنوان یک عامل محدودکننده عمل نکرد.
۳. یک یادداشت کاربر اختیاری (در صورت لزوم).

تحلیل عملکرد و معیارهای هزینه

نتایج هزینه‌ای این آزمایش تفاوت عظیمی را بین هزینه‌های AI و انسانی نشان می‌دهد. در حالی که یک حسابدار انسانی ممکن است تا ۲۸۰۰ دلار در هر فصل مطالبه کند، هزینه توکن‌های خام مدل برای کل فصل تنها ۲.۷۳ دلار بود. مدل روی لایه‌ی serverless سرویس Fireworks AI اجرا شد (احتمالاً با کوانتیزاسیون FP16 یا FP8).

جزئیات عملکرد ماهانه به شرح زیر است:

  • ژانویه: ۸ تراکنش، ۲۸ نوبت گفتگو (turn)، ۳۸ فراخوانی ابزار، ۱۰.۳ دقیقه زمان واقعی، ۸۷۱,۹۱۷ توکن ورودی (prompt)، ۳۴,۳۷۱ توکن خروجی، هزینه ۰.۴۵ دلار.
  • فوریه: ۲۹ تراکنش، ۳۷ نوبت گفتگو، ۴۴ فراخوانی ابزار، ۳۱.۴ دقیقه زمان واقعی، ۱,۸۷۳,۷۴۵ توکن ورودی، ۶۵,۹۲۹ توکن خروجی، هزینه ۰.۹۴ دلار.
  • مارس: ۲۲ تراکنش، ۴۷ نوبت گفتگو، ۵۵ فراخوانی ابزار، ۲۶.۳ دقیقه زمان واقعی، ۲,۹۸۵,۹۶۶ توکن ورودی، ۹۳,۱۸۳ توکن خروجی، هزینه ۱.۳۴ دلار.

در مجموع، مدل ۶۸ دقیقه زمان واقعی را در ۱۱۲ نوبت API صرف کرد و ۵.۷۳ میلیون توکن ورودی مصرف نمود. به دلیل اینکه کل تاریخچه گفتگو در هر نوبت دوباره ارسال می‌شد، ۹۲ تا ۹۵ درصد توکن‌ها از حافظه پنهان (cache) ارائه‌دهنده با ۲۰ درصد قیمت کمتر سرو شدند. اوج مصرف بافت (context) تقریباً یک‌هشتم پنجره بافت ۱,۰۴۸,۵۷۶ توکنی مدل بود.

دقت و جزئیات امتیازدهی

از نظر دقت، تفاوت نهایی در مبلغ خالص اظهارنامه (قسمت Box 5) تنها ۷ پنس (حدود ۱۰ سنت) با نسخه انسانی بود. برای رسیدن به این نتیجه، هر تراکنش بر اساس وضعیت نهایی در نرم‌افزار حسابداری و با استفاده از ۶ معیار ارزیابی شد:

  • نوع تراکنش: استخراج قطعی (مانند خرید، هزینه بانکی، انتقال، درآمد فروش، سرمایه معرفی شده، وام مدیر، استرداد).
  • دسته‌بندی: حساب خاص از جدول حساب‌ها (Chart of Accounts)، مانند «هزینه‌های IT و اینترنت».
  • رفتار VAT: طبقه‌بندی به عنوان Reverse charge، مالیات ۲۰٪، مالیات ۰٪ یا معاف از مالیات.
  • مبلغ VAT: با تلرانس (خطای مجاز) ۰.۰۲ پوند امتیازدهی شد.
  • VAT معکوس (Reverse-charge): با تلرانس ۰.۰۲ پوند امتیازدهی شد.
  • پیوست رسید: تأیید اینکه شواهد مورد نیاز سازمان مالیاتی موجود است.

تحلیل خطاها

از مجموع ۳۵۴ بررسی (۵۹ تراکنش × ۶ معیار)، مدل در ۲۰ مورد شکست خورد که مربوط به ۱۸ تراکنش بود. این خطاها در سه دسته قرار می‌گیرند:

۱. خطای حقوقی جدی:
بزرگترین اشتباه مربوط به «سهام مؤسسان» بود. در بریتانیا، سهامداران شرکت‌های لیمیتد سرمایه‌ای می‌پردازند که باید به عنوان «سهام پرداخت‌نشده» (Called up share capital not paid) ثبت شود. مدل به اشتباه گزینه «حساب سرمایه» (Capital Account) را انتخاب کرد. چون این مبلغ ۱۰,۰۰۰ پوند (حدود ۱۳,۳۰۰ دلار) بود، خطا جدی تلقی می‌شود. سرمایه سهام، سرمایه‌ای دائمی برای حمایت از طلبکاران است و محدودیت‌های قانونی دارد؛ نمی‌توان آن را به سادگی به مؤسس بازگرداند و باید در گزارش‌های پایان سال افشا شود. این مورد احتمالاً در یک حسابرسی حرفه‌ای به چالش کشیده می‌شد. این نوع لغزش‌ها یادآور این نکته است که استفاده از ابزارهای مالیاتی AI می‌تواند برخی از امتیازات حقوقی و مصونیت‌های کاربر را به خطر بیندازد، چرا که مسئولیت نهایی خطاها بر عهده کاربر است.

۲. سردرگمی در دسته‌بندی مالیاتی:
در ۱۴ تراکنش، مدل «نرخ صفر» (zero-rated) را با دسته‌بندی‌های «معاف از مالیات» (tax-exempt) اشتباه گرفت. اگرچه هیچ‌کدام نیاز به پرداخت VAT ندارند و اثر مالی اندک است، اما یک حسابدار خبره هرگز این دو را اشتباه نمی‌گیرد. مدل اینجا رفتار تصادفی (stochastic) داشت: در ژانویه و فوریه ۱۰۰٪ خطا کرد، اما در مارس تمام تراکنش‌های معاف از مالیات را درست پردازش کرد.

۳. خطاهای استدلالی در تراکنش‌های تقسیمی:
سه تراکنش مربوط به بانک Wise بود که ممکن است پرداخت‌ها را بین موجودی‌های ارزی مختلف تقسیم کند. در یک مورد، پرداخت به دو بخش ۰.۵۱ دلار و ۴۳.۴۵ پوند تقسیم شد. مدل با محاسبه VAT کامل روی بخش اصلی و یک بخش متناسب روی بخش باقی‌مانده، دچار «دوباره‌شمار» (double dipping) شد. جالب اینجاست که در تراکنشی مشابه در ماه مارس، مدل متوجه شد که این کار باعث محاسبه مضاعف می‌شود و مبلغ کل VAT را بین دو بخش تقسیم کرد. اگرچه این روش غیرمتعارف بود، اما می‌توانست درست باشد، با این حال ارزیاب سخت‌گیر آن را خطا دانست.

نقاط قوت و تسلط مدل

با وجود این لغزش‌ها، GLM 5.2 در ابهام‌زدایی‌های پیچیده‌ای درخشید که پیش از این نیاز به مدل‌های کلاس Frontier یا متخصصان گران‌قیمت داشت. قابلیت‌های کلیدی شناسایی شده عبارت بودند از:

  • طبقه‌بندی بی‌نقص: تمام تراکنش‌ها (به جز خطای سرمایه سهام) را به درستی در جدول حساب‌ها قرار داد.
  • ارتباط مستندات: هرگز فاکتور اشتباهی را به یک تراکنش پیوست نکرد.
  • تفکیک ورودی‌ها: دو تراکنش با مبلغ یکسان، فروشنده یکسان و تاریخ یکسان را بدون ترکیب کردن، به درستی مدیریت کرد.
  • منطق پیچیده: انتقال‌های بینبانکی شرکت، تراکنش‌های تقسیم شده در دو خط گردش‌حساب و انتقال‌های تغییر شکل داده شده به خرید کارت را به درستی شناسایی کرد.

به‌ویژه، مدل از اتصال اینترنت خود برای تحقیق در مورد نحوه ثبت VAT معکوس در نرم‌افزار حسابداری خاص مورد استفاده استفاده کرد. این موضوع توانایی مدل در «خود-اصلاحی» از طریق مستندات خارجی را ثابت می‌کند. همچنین مدل نسبت به محیط تست آگاه بود و در یک لحظه اشاره کرد: «این تکلیف در حال آزمایش این است که آیا من VAT را درست می‌گیرم یا نه... پاسخ مورد انتظار چیست».

این تغییر نشان می‌دهد که دفترداری پایه به سرعت به یک «مسئله حل‌شده» تبدیل شده است. گلوگاه اصلی دیگر توان استدلالی AI نیست، بلکه «داربست‌های» (scaffolding) مورد نیاز برای اتصال امن این مدل‌ها به ابزارهای مالی دنیای واقعی است.

برای صاحب یک کسب‌وکار متوسط، این یعنی گذار از «نظارت انسانی گران‌قیمت» به «اجرای ارزان AI با بازبینی انسانی» اکنون شدنی است. ارزش یک حسابدار در حال تغییر از «عمل ثبت تراکنش‌ها» به «برنامه‌ریزی استراتژیک مالیاتی و تأییدیه قانونی» است.

منتظر انتشار ابزارهای دفترداری خودکار در نسخه بتای عمومی باشید که این مدل‌های بازمتن را در رابط‌های امن برای کسب‌وکارها بسته‌بندی می‌کنند. شما می‌توانید نسخه بتا را در toot-books.com تست کنید یا با [email protected] ارتباط بگیرید.

گام بعدی شما

  • اگر از ابزارهای حسابداری ابری استفاده می‌کنید، بررسی کنید که آیا API آن‌ها اجازه اتصال به مدل‌های زبانی را می‌دهد یا خیر.
  • به جای سپردن تمام فرآیند به AI، مدل «بازبینی انسانی» (Human-in-the-loop) را برای موارد حساس مثل سرمایه شرکت پیاده کنید.
  • برای تجربه این قابلیت، نسخه بتای toot-books.com را بررسی نمایید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی بهره‌وری تراشه‌های جدید در استنتاج مدل‌های بازمتن مراجعه کنید.

چرا این موضوع مهم است؟

این آزمایش ثابت می‌کند مدل‌های ارزان‌قیمت و بازمتن می‌توانند کارهای تخصصی با دقت بالا انجام دهند. این موضوع باعث کاهش شدید هزینه‌های عملیاتی برای کسب‌وکارهای کوچک و تغییر پارادایم استخدام در خدمات مالی می‌شود.

تأثیر برای ایران

این مدل به دلیل وزن‌های‌باز (Open Weights) برای توسعه‌دهندگان ایرانی در دسترس است و می‌توان آن را روی سرورهای داخلی برای اتوماسیون حسابداری بومی بهینه کرد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی کامل حسابداران با AI هنوز به دلیل خطاهای حقوقی (مانند اشتباه در ثبت سرمایه) ممکن نیست، اما ارزش افزودهٔ شغل حسابداری در حال تغییر است. تخصص این افراد از «ثبت تراکنش‌ها» به «برنامه‌ریزی استراتژیک مالیاتی و تأیید قانونی» منتقل می‌شود. مدل‌های وزن‌های‌باز اکنون کیفیت لازم برای اجرای عملیات پیچیده را دارند و تنها ابزارهای اتصال امن (SME-facing interfaces) هستند که مانع پذیرش گسترده‌اند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.