اسناد
چرا خواندن اسناد فارسی سخت است
هر ابزاری ادعا میکند OCR دارد. تفاوت جایی معلوم میشود که سند فارسی، اسکنشده و بدقواره باشد — و این پنج دلیلِ فنیِ آن است.
۶ دقیقه مطالعه
مسئله زبان نیست، خط است
وقتی میگویند «OCR فارسی پشتیبانی میشود»، معمولاً یعنی مدل میتواند حروف فارسی را تشخیص دهد. این کمترین بخش کار است. سختی جای دیگری است: در شکل خط، در قراردادهای عددی، و در شکل اسنادی که واقعاً در ایران رد و بدل میشوند.
پنج مشکل زیر مستقل از هماند و هر کدام میتواند بهتنهایی یک صفحه را غیرقابلاستفاده کند.
پنج مشکل
آنچه یک صفحهٔ فارسی را سخت میکند
۱. حروف به هم میچسبند و شکلشان عوض میشود
یک حرف در ابتدا، وسط و انتهای کلمه سه شکل متفاوت دارد. برخلاف لاتین که حروف جدا از هماند، مرز بین دو حرف در فارسی همیشه یک فاصلهٔ دیداری نیست — و همین، جداسازی نویسهها را از یک مسئلهٔ ساده به یک مسئلهٔ زمینهمحور تبدیل میکند.
۲. اعداد سه شکل دارند
۱۲۳ فارسی، ١٢٣ عربی و 123 لاتین، اغلب در یک سند کنار هم. یک صورتحساب میتواند مبلغ را فارسی و شمارهٔ فاکتور را لاتین بنویسد. اگر تشخیص عدد این را نداند، رقمها یا خوانده نمیشوند یا اشتباه خوانده میشوند.
۳. جدولها خط ندارند
بسیاری از جدولهای اداری فارسی با فاصله ساخته شدهاند، نه با خط. تشخیص ساختار جدول در این حالت باید از همترازی ستونها استنتاج شود — و یک ستون کجشده در اسکن، کل شبکه را به هم میریزد.
۴. مهر و امضا روی متن مینشیند
مهر شرکت معمولاً دقیقاً روی همان سطری میافتد که مبلغ یا تاریخ در آن است. برای مدل، این یعنی دو لایهٔ بصری روی هم — و برای خواننده، یعنی همان رقمی که بیشترین اهمیت را دارد.
۵. ترتیب خواندن راستبهچپ است، اما نه همیشه
متن راست به چپ میرود و اعداد و عبارات لاتین درونش چپ به راست. یک صفحهٔ دوزبانه ترتیب خواندنی دارد که باید بازسازی شود، وگرنه خروجی «درست» است و بیمعنی.
در این محصول
چه کاری با اینها میشود کرد
پالسآپ برای همین حالت ساخته شد، نه برای حالت ساده. تشخیص اعداد فارسی بخشی از مسیر خواندن سند است و ایندکس جستوجو برای فارسی ساخته شده — «ی» و «ي»، «ک» و «ك» و نیمفاصله در ایندکس یکی میشوند، وگرنه نیمی از جستوجوها بینتیجهاند و کسی نمیفهمد چرا.
اما مهمتر از هر ادعای دقتی، این است: هر رقمی که بیرون میآید، صفحه و سطر سند منبعش را همراه دارد. چون هیچ سیستمی روی اسکن بد صددرصد درست نیست، و تنها پاسخ صادقانه این است که بررسیکردن را ارزان کنیم — نه اینکه وانمود کنیم خطا وجود ندارد.
- تشخیص اعداد فارسی در مسیر خواندن سند
- ایندکس جستوجوی فارسی با یکسانسازی ی/ي و ک/ك
- ارجاع به صفحهٔ منبع روی هر رقم
- بازبینی انسانی پیش از آنکه رقمی وارد کار شود
- ## صورت وضعیت مالی
- | سرفصل | ۱۴۰۳ | ۱۴۰۲ |
- | موجودی نقد | ۸۴٬۱۲۰ | ۶۱٬۵۴۰ |
- | دریافتنیهای تجاری | ۴۰۲٬۸۸۰ | ۳۶۶٬۲۱۰ |
صفحهٔ ۱۲ را سارا تأیید کرد
پرسشهای پرتکرار
دقتش چند درصد است؟
عددی اعلام نمیکنیم، چون هر عددی بدون گفتن اینکه روی چه مجموعهای اندازهگیری شده بیمعنی است و مجموعهٔ اسناد شما با مجموعهٔ آزمون ما فرق دارد. کاری که میتوانید بکنید این است: بدترین اسکنی که دارید را بیاورید و نتیجه را خودتان ببینید.اگر اشتباه بخواند چه میشود؟
همان دلیلی است که ارجاع به صفحهٔ منبع وجود دارد. هر رقم یک کلیک با سند اصلی فاصله دارد، و بازبینی انسانی پیش از ورود به کار انجام میشود. سیستمی که ادعا کند بازبینی لازم نیست، ادعای بزرگتری کرده تا آنچه میتواند نگه دارد.سند دستنویس را هم میخواند؟
خیر. دستخط خارج از دامنهٔ کاری امروز محصول است و وانمود نمیکنیم که نیست.
با دادهٔ واقعی خودتان امتحان کنید
نسخهٔ رایگان محدودیت زمانی ندارد. سختترین سندی که دارید را بیاورید.