غالبا ما ينطوي نظام استخراج المعلومات العالمي الحقيقي (IE) لصور وثيقة شبه منظمة أن خط أنابيب طويل من وحدات متعددة، مما يزيد تعقيده بشكل كبير من تكلفة التطوير والصيانة.يمكن للمرء بدلا من ذلك النظر في نموذج نهاية إلى نهاية يدري مباشرة المدخلات إلى الإخراج المستهدف وتبسيط العملية بأكملها.ومع ذلك، يعرف نهج هذا الجيل أن يؤدي إلى أداء غير مستقر إذا لم يتم تصميمه بعناية.هنا نقدم جهدنا الأخير على الانتقال من نظام IE الحالي الذي يعتمد على خط الأنابيب إلى نظام نهاية إلى نهاية يركز على التحديات العملية المرتبطة باستبدال ونشر النظام في الإنتاج الحقيقي والنطاق على نطاق واسع.من خلال صياغة المستند بعناية أي مهمة توليد التسلسل، نوضح أن نظام IE نهاية واحدة إلى النهاية يمكن بناؤه ولا يزال يحقق الأداء المختص.
A real-world information extraction (IE) system for semi-structured document images often involves a long pipeline of multiple modules, whose complexity dramatically increases its development and maintenance cost. One can instead consider an end-to-end model that directly maps the input to the target output and simplify the entire process. However, such generation approach is known to lead to unstable performance if not designed carefully. Here we present our recent effort on transitioning from our existing pipeline-based IE system to an end-to-end system focusing on practical challenges that are associated with replacing and deploying the system in real, large-scale production. By carefully formulating document IE as a sequence generation task, we show that a single end-to-end IE system can be built and still achieve competent performance.
المراجع المستخدمة
https://aclanthology.org/
في هذه الدراسة، نوضح جدوى نشر نماذج نمط بيرت إلى AWS Lambda في بيئة الإنتاج.نظرا لأن النماذج المدربة مسبقا متوفرة بحرية كبيرة جدا بحيث لا يتم نشرها في هذه البيئة، فإننا نستخدم تقارير المعرفة وضبط النماذج على مجموعات البيانات الخاصة بمهام عمليتين في ا
غالبا ما يتطلب فهم الروايات بالكامل من الأحداث في سياق المستندات بأكملها ونمذجة علاقات الحدث.ومع ذلك، فإن استخراج الأحداث على مستوى المستند هو مهمة صعبة لأنها تتطلب استخراج الحدث والكيان الأساسية، والتقاط الحجج التي تمتد عبر جمل مختلفة.تعمل الأعمال ا
تفترض أن معظم الدراسات السابقة حول حالة المعلومات (IS) تصنيف وتجسير التعرف anaphora أن ذكر الذهب أو معلومات شجرة النحوية يتم إعطاء (Hou et al.، 2013؛ Roesiger et al.، 2018؛ هو، 2020؛ يو ويوسيو، 2020) وبعد في هذه الورقة، نقترح نهج عصبي نهاية إلى نهج ل
تستخرف تستخرف توائم النص من النص الخام مهمة حاسمة في استخراج المعلومات، مما يتيح تطبيقات متعددة مثل ملء قواعد المعرفة أو التحقق من صحة المعرفة ومهام المصب الأخرى. ومع ذلك، فإنه عادة ما ينطوي عادة على خطوط أنابيب متعددة الخطوات التي تنتشر أخطاء أو تقت
إن دمج قواعد المعرفة (KB) في أنظمة الحوار الموجهة نحو المهام الواحد أمرا صعبا، لأنها تتطلب تمثيل كيان KB بشكل صحيح، وهو مرتبط بسياق KB وحالات الحوار. تمثل الأعمال الحالية الكيان مع إدراك جزء من سياق KB فقط، والذي يمكن أن يؤدي إلى تمثيل أقل فعالية بسب