ذكاء اصطناعي لتصنيف المستندات
تصنيف بالذكاء الاصطناعي باستخدام RAG لتصنيف المستندات القانونية وتوجيهها
التحدي
كان الفريق القانوني في شركة خدمات قانونية يفرز آلاف المستندات يدويًا كل أسبوع — عقود، ملفات محاكم، مراسلات، أدلة، مواد استكشاف — إلى مجلدات القضايا ومجالات الممارسة الصحيحة. كان هذا عملاً مملًا وعرضة للأخطاء يتطلب خبرة قانونية للقيام به بشكل صحيح، مما يعني أن المساعدين القانونيين المكلفين كانوا يقضون وقتهم في الأرشفة بدلاً من التحليل القانوني.
تفاقمت المشكلة بسبب الحجم. خلال عمليات الاستكشاف الكبيرة، كان الفريق يتلقى عشرات الآلاف من المستندات التي تحتاج إلى تصنيف ومراجعة للامتياز وتوجيهها إلى المحامي المناسب. لم تتمكن التصنيف اليدوي من مواكبة الأمر، وكانت التأخيرات تعني أن المحامين كانوا ينتظرون المستندات المنظمة بدلاً من بناء قضيتهم.
الحل
قمنا ببناء ذكاء اصطناعي لتصنيف المستندات يقرأ كل مستند، ويفهم محتواه وسياقه، ويصنفه تلقائيًا في القضية ومجال الممارسة ونوع المستند الصحيحين. يستخدم النظام RAG لمقارنة كل مستند بتصنيف تصنيف الشركة والأمثلة التاريخية.
لا يطابق الذكاء الاصطناعي الكلمات المفتاحية فحسب — بل يفهم السياق القانوني. يمكنه التمييز بين عقد وتعديل عقد، بين ملف محكمة وأمر مقترح، بين مراسلات مميزة وبريد إلكتروني تجاري. للاستكشاف، يعلّم النظام أيضًا المستندات التي يحتمل أن تكون مميزة لمراجعة المحامي ويحدد المستندات التي تطابق موضوعات قضية محددة.
التقنيات
النظام مبني بـ Python مع LangChain لخط أنابيب التصنيف، و Pinecone لتخزين تضمينات المستندات وتصنيف التصنيف، و OpenAI لفهم النص، و FastAPI لطبقة الخدمة. تُستوعب المستندات عبر واجهة برمجة أو رفع ملفات، وتُعالج عبر OCR عند الحاجة، وتُصنَّف في الوقت الفعلي.
نهج RAG هو المفتاح: بدلاً من تدريب مصنف تقليدي على بيانات معنونة، يسترجع النظام مستندات تاريخية مشابهة من Pinecone ويستخدمها كسياق لقرار التصنيف. هذا يعني أنه يمكن إضافة أنواع مستندات جديدة ببساطة بإضافة أمثلة إلى قاعدة المعرفة — لا حاجة لإعادة تدريب النموذج. يولد النظام أيضًا درجة ثقة ويوجه التصنيفات منخفضة الثقة إلى مراجع بشري للتحقق.
النتائج
حقق النظام دقة عالية في التصنيف التلقائي، مما يعني أن الغالبية العظمى من المستندات تُؤرشف بشكل صحيح دون مراجعة بشرية. وفر الفريق القانوني ساعات عمل قيّمة أسبوعيًا كانت تُقضى سابقًا في الفرز اليدوي، وأعاد تخصيصها لأعمال قانونية قابلة للفوترة.
أصبح استرجاع المستندات أسرع بشكل ملحوظ لأن المستندات كانت مصنفة بشكل متسق وقابلة للبحث حسب الفئة والقضية ونوع المستند. خلال عملية استكشاف رئيسية، عالج النظام آلاف المستندات في أيام — عمل كان سيستغرق الفريق أسابيع يدويًا. ميزة تعليم الامتياز التقطت عددًا كبيرًا من المستندات كان يمكن إنتاجها عن غير قصد، مما قد ينقذ الشركة من تعرض خطير للممارسة الخاطئة.
لقطات الشاشة
تصنيف المستندات مع درجات الثقة
لوحة تعرض أحجام التصنيف والدقة
البنية التقنية
يتبع النظام خط أنابيب تصنيف قائم على RAG. تُستوعب المستندات عبر نقطة نهاية FastAPI، وتُعالَج عبر OCR عند الحاجة، وتُحوَّل إلى نص. يولد خط أنابيب LangChain التضمينات، ويسترجع مستندات تاريخية مشابهة من Pinecone، ويستخدمها كسياق لمطالبة التصنيف.
ينتج التصنيف فئة وفئة فرعية ودرجة ثقة وتسبيب. تُؤرشف التصنيفات عالية الثقة تلقائيًا؛ تُوضع التصنيفات منخفضة الثقة في طابور المراجعة البشرية. تُخزِّن حلقة التغذية الراجعة تصحيحات المراجعين البشريين كأمثلة جديدة في Pinecone، مما يحسن النظام باستمرار. تعرض لوحة التحكم أحجام التصنيف واتجاهات الدقة وطابور المراجعة البشرية.
التقنيات المستخدمة
لنبني شيئاً رائعاً معاً
هل أنت مستعد لأتمتة عمليات عملك وتوفير مئات الساعات كل شهر؟ لنتحدث عن مشروعك.