پردازش پرونده خسارت بیمه با OCR فارسی - از پاکت کاغذی تا داده قابل بررسی
در بیمه، حساسترین لحظه رابطه با مشتری همانجاست که خسارت اعلام میشود - و همانجا هم کندترین بخش کار است. این مقاله بهجای کلیگویی درباره هوش مصنوعی، به یک پرونده خسارت واقعی نگاه میکند و میگوید کدام قسمتش با OCR فارسی و استخراج خودکار داده کوتاه میشود، کدام قسمتش نباید خودکار شود، و پیش از شروع باید چه چیزی را اندازه بگیرید.
در این صفحه
یک پرونده خسارت واقعاً از چه چیزهایی تشکیل شده؟
پیش از هر بحثی درباره هوش مصنوعی، ارزش دارد یک لحظه به خودِ پرونده نگاه کنیم. یک پرونده خسارت متوسط - چه اتومبیل، چه درمان، چه باربری - معمولاً ترکیبی است از:
- فرم اعلام خسارت - چاپی، اما پرشده با دستخط بیمهگذار
- گزارش کارشناس - اغلب کاملاً دستنویس، گاهی روی فرم، گاهی روی کاغذ ساده
- فاکتور تعمیرگاه یا مرکز درمانی - چاپی، با مهر و امضا که معمولاً روی متن میافتد
- مدارک هویتی و بیمهنامه - اسکن یا عکس موبایل با کیفیتهای بسیار متفاوت
- پیوستهای متفرقه - تصویر صحنه، رسید، نامه، پیام
و نکتهای که هر کارشناس خسارتی میداند: این مدارک همزمان نمیرسند. پرونده باز میشود، چند مدرک میآید، یکی کم است، پیگیری میشود، چند روز بعد میرسد. پرونده در این فاصله فقط منتظر است.
وقت واقعاً کجا میرود؟
تصور رایج این است که زمان رسیدگی صرف تصمیمگیری میشود. در عمل معمولاً اینطور نیست. بخش عمده زمان صرف کارهایی میشود که هیچکدام قضاوت کارشناسی نیستند:
اینها کارهای تکراریاند، و دقیقاً به همین دلیل خودکارسازیپذیرند. تصمیم درباره پرداخت یا رد خسارت - که واقعاً قضاوت میخواهد - چیز دیگری است و در ادامه به آن میرسیم.
اثر جانبی این وضعیت هم مهم است: وقتی ورود داده دستی باشد، دو کارشناس یک پرونده را دو جور ثبت میکنند. نتیجه، پروندههایی است که بعداً قابل مقایسه و تحلیل نیستند - و همان جایی است که گزارشگیری مدیریتی از کار میافتد.
چه چیزی خودکار میشود و چه چیزی نمیشود
این تفکیک مهمترین بخش این مقاله است، چون بیشتر ناامیدیها از پروژههای هوش مصنوعی از همینجا شروع میشود که مرزش از اول روشن نبوده.
آنچه خودکار میشود
- تشخیص نوع سند - سیستم میفهمد این برگه فاکتور است یا گزارش کارشناس یا کارت ملی
- استخراج اقلام - تاریخ، مبلغ، شماره بیمهنامه، نام، شماره فاکتور، اقلام هزینه
- تطبیق با بیمهنامه - آیا شماره بیمهنامه معتبر است؟ تاریخ حادثه در بازه پوشش هست؟ این قلم اصلاً تحت پوشش است؟
- تشخیص نقص مدارک - چه چیزی برای این نوع خسارت لازم است و هنوز نیامده
- علامتگذاری موارد پرت - مبلغی که با الگوی معمول همان نوع خسارت نمیخواند
آنچه خودکار نمیشود - و نباید بشود
- تصمیم پرداخت یا رد - این تصمیم تبعات حقوقی و قراردادی دارد و باید توسط کارشناس گرفته و امضا شود
- تفسیر گزارش پزشکی یا فنی - سیستم متن را میخواند، معنای بالینی یا مهندسیاش را قضاوت نمیکند
- تشخیص تقلب بهعنوان حکم نهایی - مدل میتواند الگوی غیرعادی را علامت بزند، اما «مشکوک» با «متقلبانه» یکی نیست
به بیان ساده: هوش مصنوعی پرونده را آماده تصمیم میکند، تصمیم را نمیگیرد. اگر فروشندهای چیز دیگری وعده داد، بپرسید در صورت اشتباه، مسئولیتش با کیست.
میخواهید بدانید اسناد شما چقدر قابل استخراجاند؟
نمونه واقعی پروندههای خودتان را آزمایش میکنیم و نتیجه همان آزمایش را میگوییم - نه یک عدد عمومی.
گردشکار پیشنهادی، مرحله به مرحله
این همان مسیری است که در پلتفرم هوش اسناد کارن پیاده میشود. شش مرحله دارد و هر مرحله خروجی قابل بازبینی تولید میکند - نه یک جعبه سیاه که ورودی بگیرد و تصمیم بدهد.
۱. دریافت
مدارک از هر کانالی که امروز میآیند وارد میشوند: اسکنر شعبه، ایمیل، پیامرسان یا اپلیکیشن بیمهگذار. نکته اینجاست که کانال جدیدی به بیمهگذار تحمیل نشود؛ هر کانالی که الان کار میکند باید کار کند.
۲. تفکیک و طبقهبندی
یک پاکت اسکنشده معمولاً چند سند مختلف است که پشت سر هم اسکن شدهاند. اول باید مرز اسناد پیدا شود و بعد نوع هرکدام تشخیص داده شود. این مرحله را اغلب دستکم میگیرند، در حالی که خطای اینجا به همه مراحل بعد منتقل میشود.
۳. استخراج
برای هر نوع سند، اقلام تعریفشده استخراج میشوند. متن چاپی و دستنویس هر دو پشتیبانی میشوند، ولی با اطمینان متفاوت - و همین تفاوت باید در خروجی دیده شود، نه پنهان بماند.
۴. تطبیق با بیمهنامه
اقلام استخراجشده مقابل سامانه بیمهنامه گذاشته میشوند: اعتبار بیمهنامه در تاریخ حادثه، شمول پوشش، سقف تعهد و فرانشیز. خروجی این مرحله فهرست مغایرتهاست، نه یک تأیید کلی.
۵. صف بررسی انسانی
هر قلمی که اطمینان استخراجش پایین باشد یا با بیمهنامه نخواند، به صف کارشناس میرود - با تصویر اصلی در کنارش، تا کارشناس بهجای تایپ، فقط تأیید یا اصلاح کند. پروندههایی که هیچ مغایرتی ندارند مستقیم به مرحله تصمیم میروند، ولی تصمیم همچنان انسانی است.
۶. بایگانی قابل جستوجو
پرونده با داده استخراجشده بایگانی میشود، پس از این به بعد قابل جستوجو و قابل تحلیل است. این نقطهای است که گزارشگیری مدیریتی - که تا امروز روی داده ناهمگون ممکن نبود - معنا پیدا میکند.
چه چیزی روی دقت اثر میگذارد
هیچکس نمیتواند پیش از دیدن اسناد شما عددی برای دقت اعلام کند، و هر کس چنین کند دارد حدس میزند. اما میشود گفت دقت به چه چیزهایی بستگی دارد:
- دستخط - گزارش کارشناسی که با خودکار و شتاب نوشته شده، سختترین ورودی این حوزه است
- مهر روی متن - مهر تعمیرگاه یا مرکز درمانی اغلب دقیقاً روی مبلغ میافتد
- عکس موبایل - زاویه، سایه، تاشدگی کاغذ و بازتاب نور همه اثر دارند
- کاربن و رونوشت - نسخه دوم فرمها معمولاً کمرنگ است
- تنوع فرم - هر تعمیرگاه فرم خودش را دارد؛ تعداد قالبهای متفاوت، خودش یک متغیر است
استقرار، انطباق و ممیزی
پرونده خسارت حاوی داده هویتی، مالی و گاهی درمانی است. سه الزام از همینجا میآید:
- استقرار روی زیرساخت خودتان - داده و مدل هر دو داخل شبکه شما میمانند و پرونده به هیچ سرویس بیرونی ارسال نمیشود
- ثبت کامل لاگ - چه کسی چه پروندهای را دید، چه قلمی خودکار استخراج شد و چه قلمی را کارشناس اصلاح کرد
- قابلیت بازگشت به سند اصلی - هر عدد در سیستم باید به تصویر همان برگهای که از آن آمده قابل ردیابی باشد
مورد سوم فقط یک ویژگی فنی نیست؛ در رسیدگی به شکایت یا ممیزی، همان چیزی است که پرونده را قابل دفاع میکند.
نقطه شروع واقعبینانه
توصیه ما شروع با یک نوع خسارت است، نه همه انواع با هم. دلیلش ساده است: هر نوع خسارت مجموعه مدارک و قواعد خودش را دارد، و دامنه کوچک یعنی نتیجه در چند هفته دیده میشود نه چند فصل.
و یک نکته که کمتر گفته میشود: پیش از شروع، وضعیت فعلی را اندازه بگیرید - میانگین زمان از تشکیل پرونده تا تصمیم، و سهم پروندههایی که بهخاطر نقص مدارک برمیگردند. بدون این دو عدد، بعداً هیچکس نمیتواند بگوید پروژه چقدر اثر داشته، و بحث به سلیقه کشیده میشود.
اگر میخواهید تصویر کاملتری از کاربردهای هوش مصنوعی در این صنعت ببینید - از دستیار دانش شبکه نمایندگان تا پیشبینی عدم تمدید - صفحه راهکارهای صنعت بیمه همه را کنار هم گذاشته است. برای پاسخگویی خودکار به بیمهگذار هم چتبات بیمه مانوتل نقطه شروع جداگانهای است.
پرسشهای متداول
OCR فارسی کارن از متن چاپی و دستنویس هر دو پشتیبانی میکند، اما دستخط سختترین ورودی این حوزه است و نتیجه از پروندهای به پرونده دیگر فرق میکند. به همین دلیل خروجی هر قلم با درجه اطمینان همراه است و اقلام کماطمینان به صف بررسی کارشناس میروند. عدد دقت واقعی شما فقط پس از آزمایش روی نمونه اسناد خودتان قابل اعلام است.
خیر، و این یک تصمیم طراحی است نه محدودیت فنی. سیستم پرونده را آماده تصمیم میکند: اقلام را استخراج میکند، با بیمهنامه تطبیق میدهد و مغایرتها را علامت میزند. تصمیم پرداخت یا رد - که تبعات حقوقی و قراردادی دارد - با کارشناس است.
مدل میتواند الگوهای غیرعادی را علامت بزند - مبلغی که با الگوی معمول همان نوع خسارت نمیخواند، یا تکرار مشکوک. اما «مشکوک» با «متقلبانه» یکی نیست. خروجی، فهرست موارد نیازمند بررسی است، نه حکم.
خیر، در حالت استقرار داخلی که برای این نوع داده پیشنهاد ماست. مدل و داده هر دو روی زیرساخت خودتان میمانند و هیچ پروندهای به سرویس بیرونی ارسال نمیشود.
یکپارچهسازی بخشی از پروژه است، نه افزونهای جدا. اتصال معمولاً از طریق API یا پایگاه داده میانی انجام میشود و مسیر عملیاتی سامانه فعلی دستنخورده میماند. دامنه دقیق اتصال در جلسه ارزیابی مشخص میشود.
برای آزمایش اولیه، چند ده نمونه واقعی از هر نوع سند کافی است تا تصویر درستی از کیفیت ورودی به دست بیاید. برای استقرار، آنچه اهمیت دارد پوشش تنوع فرمهاست - یعنی نمونههایی از همه قالبهایی که در عمل دریافت میکنید، نه صرفاً تعداد زیاد از یک نوع.
با دو عددی که باید پیش از شروع اندازه بگیرید: میانگین زمان از تشکیل پرونده تا تصمیم، و سهم پروندههایی که بهخاطر نقص مدارک برمیگردند. اگر این دو را از قبل نداشته باشید، بعد از استقرار هیچکس نمیتواند اثر را ثابت کند و بحث به سلیقه کشیده میشود.





