پرش به محتوا

اسناد

چرا خواندن اسناد فارسی سخت است

هر ابزاری ادعا می‌کند OCR دارد. تفاوت جایی معلوم می‌شود که سند فارسی، اسکن‌شده و بدقواره باشد — و این پنج دلیلِ فنیِ آن است.

۶ دقیقه مطالعه

مسئله زبان نیست، خط است

وقتی می‌گویند «OCR فارسی پشتیبانی می‌شود»، معمولاً یعنی مدل می‌تواند حروف فارسی را تشخیص دهد. این کمترین بخش کار است. سختی جای دیگری است: در شکل خط، در قراردادهای عددی، و در شکل اسنادی که واقعاً در ایران رد و بدل می‌شوند.

پنج مشکل زیر مستقل از هم‌اند و هر کدام می‌تواند به‌تنهایی یک صفحه را غیرقابل‌استفاده کند.

پنج مشکل

آنچه یک صفحهٔ فارسی را سخت می‌کند

  1. ۱. حروف به هم می‌چسبند و شکلشان عوض می‌شود

    یک حرف در ابتدا، وسط و انتهای کلمه سه شکل متفاوت دارد. برخلاف لاتین که حروف جدا از هم‌اند، مرز بین دو حرف در فارسی همیشه یک فاصلهٔ دیداری نیست — و همین، جداسازی نویسه‌ها را از یک مسئلهٔ ساده به یک مسئلهٔ زمینه‌محور تبدیل می‌کند.

  2. ۲. اعداد سه شکل دارند

    ۱۲۳ فارسی، ١٢٣ عربی و 123 لاتین، اغلب در یک سند کنار هم. یک صورت‌حساب می‌تواند مبلغ را فارسی و شمارهٔ فاکتور را لاتین بنویسد. اگر تشخیص عدد این را نداند، رقم‌ها یا خوانده نمی‌شوند یا اشتباه خوانده می‌شوند.

  3. ۳. جدول‌ها خط ندارند

    بسیاری از جدول‌های اداری فارسی با فاصله ساخته شده‌اند، نه با خط. تشخیص ساختار جدول در این حالت باید از هم‌ترازی ستون‌ها استنتاج شود — و یک ستون کج‌شده در اسکن، کل شبکه را به هم می‌ریزد.

  4. ۴. مهر و امضا روی متن می‌نشیند

    مهر شرکت معمولاً دقیقاً روی همان سطری می‌افتد که مبلغ یا تاریخ در آن است. برای مدل، این یعنی دو لایهٔ بصری روی هم — و برای خواننده، یعنی همان رقمی که بیشترین اهمیت را دارد.

  5. ۵. ترتیب خواندن راست‌به‌چپ است، اما نه همیشه

    متن راست به چپ می‌رود و اعداد و عبارات لاتین درونش چپ به راست. یک صفحهٔ دوزبانه ترتیب خواندنی دارد که باید بازسازی شود، وگرنه خروجی «درست» است و بی‌معنی.

در این محصول

چه کاری با این‌ها می‌شود کرد

پالس‌آپ برای همین حالت ساخته شد، نه برای حالت ساده. تشخیص اعداد فارسی بخشی از مسیر خواندن سند است و ایندکس جست‌وجو برای فارسی ساخته شده — «ی» و «ي»، «ک» و «ك» و نیم‌فاصله در ایندکس یکی می‌شوند، وگرنه نیمی از جست‌وجوها بی‌نتیجه‌اند و کسی نمی‌فهمد چرا.

اما مهم‌تر از هر ادعای دقتی، این است: هر رقمی که بیرون می‌آید، صفحه و سطر سند منبعش را همراه دارد. چون هیچ سیستمی روی اسکن بد صددرصد درست نیست، و تنها پاسخ صادقانه این است که بررسی‌کردن را ارزان کنیم — نه اینکه وانمود کنیم خطا وجود ندارد.

  • تشخیص اعداد فارسی در مسیر خواندن سند
  • ایندکس جست‌وجوی فارسی با یکسان‌سازی ی/ي و ک/ك
  • ارجاع به صفحهٔ منبع روی هر رقم
  • بازبینی انسانی پیش از آنکه رقمی وارد کار شود
اسناد · صورت‌های مالی ۱۴۰۳.pdf
صورت‌های مالی ۱۴۰۳.pdf۴۸ صفحه
کامل شدبدون صفحهٔ ازدست‌رفته
  • ## صورت وضعیت مالی
  • | سرفصل | ۱۴۰۳ | ۱۴۰۲ |
  • | موجودی نقد | ۸۴٬۱۲۰ | ۶۱٬۵۴۰ |
  • | دریافتنی‌های تجاری | ۴۰۲٬۸۸۰ | ۳۶۶٬۲۱۰ |

صفحهٔ ۱۲ را سارا تأیید کرد

پرسش‌های پرتکرار

  • دقتش چند درصد است؟
    عددی اعلام نمی‌کنیم، چون هر عددی بدون گفتن اینکه روی چه مجموعه‌ای اندازه‌گیری شده بی‌معنی است و مجموعهٔ اسناد شما با مجموعهٔ آزمون ما فرق دارد. کاری که می‌توانید بکنید این است: بدترین اسکنی که دارید را بیاورید و نتیجه را خودتان ببینید.
  • اگر اشتباه بخواند چه می‌شود؟
    همان دلیلی است که ارجاع به صفحهٔ منبع وجود دارد. هر رقم یک کلیک با سند اصلی فاصله دارد، و بازبینی انسانی پیش از ورود به کار انجام می‌شود. سیستمی که ادعا کند بازبینی لازم نیست، ادعای بزرگ‌تری کرده تا آنچه می‌تواند نگه دارد.
  • سند دست‌نویس را هم می‌خواند؟
    خیر. دست‌خط خارج از دامنهٔ کاری امروز محصول است و وانمود نمی‌کنیم که نیست.

با دادهٔ واقعی خودتان امتحان کنید

نسخهٔ رایگان محدودیت زمانی ندارد. سخت‌ترین سندی که دارید را بیاورید.