أوراق بحثية, رسائل ماجستير ودكتوراه حول multimodal

Iconary: لعبة قوية قائمة على اختبار التواصل متعدد الوسائط بالرسومات والنص

628 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

يتعرض التواصل مع البشر صعبة بالنسبة ل AIS لأنه يتطلب فهما مشتركا للعالم والمعقدين المعقدة (على سبيل المثال، الاستعارات أو التظليل)، وفي بعض الأحيان إيماءات متعددة الوسائط (E.G.، مشيرا بإصبع، أو سهم في رسم تخطيطي). نحن نبحث في هذه التحديات في سياق الأ كوناري، وهي لعبة تعاونية للرسم والتخمين على أساس المخيث، يشكل تحديا جديدا لمجتمع البحث. في الأونلاري، يحاول تخميس تحديد عبارة أن درج يرسم عن طريق تأليف الرموز، ويعزز الدرج بشكل دائم الرسم لمساعدة التخمين في الاستجابة. غالبا ما يستخدم هذا الخلف والمشاهد الكانيكية واستعارة مرئية أو مؤلفات أيقونة للتعبير عن الكلمات الصعبة، مما يجعلها اختبارا مثاليا لخلط اللغة والاتصال المرئي / الرمزي في AI. نقترح نماذج للعب Iconary وتدريبها على أكثر من 55000 مباراة بين اللاعبين البشريين. نماذجنا هي لاعبين ماهرين ويمكنهم استخدام المعرفة العالمية في نماذج اللغة للعب مع الكلمات غير المرئية أثناء التدريب.

testing multimodal communication testing multimodal multimodal communication اختبار الاتصالات متعددة الوسائط اختبار multimodal. الاتصالات متعددة الوسائط صناعة حمض الفوسفور المزيد..

newsclippings: الجيل التلقائي لوسائط الوسائط المتعددة خارج السياق

635 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

التضليل عبر الإنترنت هو قضية اجتماعية سائدة، مع anversaries تعتمد على الأدوات التي تتراوح من مزيفة رخيصة إلى مزيفة عميقة متطورة. نحن دوافع من سيناريو التهديد حيث يتم استخدام صورة خارج السياق لدعم سرد معين. في حين أن بعض مجموعات البيانات السابقة للكشف عن تناسق نص الصورة تولد عينات من خلال معالجة النص، نقترح مجموعة بيانات حيث تكون كل من الصور والنص غير المدمجة ولكن غير متطابقة. نقدم عدة استراتيجيات لاستعادة الصور المقنعة تلقائيا للحصول على تعليق معين، والتقاط الحالات مع كيانات غير متناسقة أو السياق الدلالي. لدينا نطاق واسع النطاق تلقائيا لوحة بيانات الأخبار: (1) يوضح أن إعادة شحن الصورة التي يحركها الجهاز هي الآن تهديد واقعي، و (2) توفر عينات تمثل حالات تحديا غير متطابقة بين النص والصورة في الأخبار التي تتمكن من تضليل البشر وبعد نحن نقسم عدة نماذج متعددة الوسائط في مجموعة بياناتنا وتحليل أدائها عبر مجالات محاكمة مختلفة والشبكات المرئية.

automatic generation multimodal media automatic الجيل التلقائي وسائل الإعلام متعددة الوسائط التلقائي صناعة حمض الفوسفور المزيد..

يمكن أن تساعد الصور على التعرف على الكيانات؟دراسة دور الصور لعدة متعددة

661 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

يتطلب التعرف على الكيان المسمى MultiModal (MNER) سد الفجوة بين فهم اللغة والسياق المرئي.في حين أن العديد من التقنيات العصبية متعددة الوسائط قد تم اقتراح دمج الصور في مهمة MNER، فإن قدرة النموذج على الاستفادة من التفاعلات متعددة الوسائط لا تزال مفهومة سيئة.في هذا العمل، نقوم بإجراء تحليلات متعمقة من تقنيات الانصهار متعددة الوسائط المتعددة من وجهات نظر مختلفة ووصف السيناريوهات حيث لا تؤدي إضافة معلومات من الصورة دائما إلى زيادة الأداء.ندرس أيضا استخدام التسميات التوضيحية كوسيلة لإثراء السياق ل MNER.تعرض التجارب في ثلاث مجموعات من المنصات الاجتماعية الشعبية عنق الزجاجة من النماذج متعددة الوسائط الحالية والحالات التي يستخدمها المساميرات مفيدة.

recognize entities multimodal multimodal ner التعرف على الكيانات multimodal. multimodal ner. صناعة حمض الفوسفور المزيد..

التقاط الهيكل المنطقي للوثائق المنظمة بصريا مع محلل انتقال متعدد الوسائط

632 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

في حين أن العديد من خطوط أنابيب NLP تفترض أن النصوص النظيفة النظيفة، فإن العديد من النصوص التي نواجهها في البرية، بما في ذلك الغالبية العظمى من المستندات القانونية، ليست نظيفة للغاية، حيث يجري العديد منهم وثائق منظم بصريا (VSDS) مثل PDF. تقوم الأدوات المعالجة التقليدية ل VSDS تركز بشكل أساسي على تجزئة الكلمات وتحليل التخطيط الخشن، في حين أن تحليل الهيكل المنطقي المحلقات الدقيقة (مثل تحديد حدود الفقرة وهرميها) من VSDS هي غير متكسدة. تحقيقا لهذه الغاية، اقترحنا صياغة المهمة كتنبؤ بملميات الانتقال "بين شظايا الرسائل النصية التي تعرض الشظايا إلى شجرة، وتطوير نظام لتعلم الماكينات المستندة إلى ميزة يمبرص إشارات مرئية ونصية ودلية. يتم تخصيص نظامنا بسهولة إلى أنواع مختلفة من VSDS وكانت خطوط الأساس بشكل كبير في تحديد الهياكل المختلفة في VSDS. على سبيل المثال، حصل نظامنا على درجة الكشف عن حدود الفقرة 0.953 أفضل بكثير من أداة PDF-To-to-todly ذات درجة كبيرة مع درجة F1 من 0.739.

multimodal transition parser visually structured documents capturing logical structure محلل الانتقال متعددة الوسائط وثائق منظمة بصريا التقاط الهيكل المنطقي صناعة حمض الفوسفور المزيد..

مما يجعل المساهمة: تعديل ديناميات غير مهادة وعبرية لتحليل المعنويات متعددة الوسائط

1061 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

تحليل المعنويات متعددة الوسائط (MSA) يرسم اهتماما متزايدا بتوافر بيانات متعددة الوسائط. يعوق دفعة في أداء نماذج MSA بشكل رئيسي بمشاكل. من ناحية، تعمل MSA الأخيرة على التركيز في الغالب على تعلم الديناميات عبر الوسائط، ولكن الإهمال لاستكشاف الحل الأمثل للشبكات غير المستقرة، والتي تحدد الحد الأدنى لنماذج MSA. من ناحية أخرى، يتداخل المعلومات الصاخبة المخفية في كل طريقة في تعلم ديناميات العرض الصحيحة الصحيحة. لمعالجة المشكلات المذكورة أعلاه، نقترح نموذج تعديل إطار MSA MSA لتحليل المشاعر المتعدد الوسائط (M3SA) لتحديد مساهمة الطرائق وتقليل تأثير المعلومات الصاخبة، وذلك لتحسين تعلم ديناميات غير مهادة وعبرية. على وجه التحديد، تم تصميم خسارة التشكيل لتعديل مساهمة الخسارة على أساس ثقة الطرائق الفردية في كل كلام، وذلك لاستكشاف حل تحديث الأمثل لكل شبكة غير مهام. بالإضافة إلى ذلك، عكس ذلك، فإن معظم الأعمال الموجودة التي تفشل في تصفية المعلومات الصاخبة بشكل صريح، ونحن نضع وحدة تصفية طريقة للتعريف لتحديد وتصفية ضوضاء الوسوية لتعلم التضمين الصحيحة والعصرية. تجارب واسعة النطاق على مجموعات البيانات العامة تثبت أن نهجنا يحقق الأداء الحديثة.

multimodal sentiment analysis multimodal sentiment تحليل المشاعر متعددة الوسائط المشاعر متعددة الوسائط صناعة حمض الفوسفور

كيفية الاستفادة من بيانات EHR متعددة الوسائط لتحسين التنبؤ الطبي؟

584 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

أصبحت الرعاية الصحية موضوع بحث أكثر وأكثر أهمية مؤخرا. مع البيانات المتنامية في مجال الرعاية الصحية، فإنه يوفر فرصة رائعة للتعلم العميق لتحسين جودة الخدمة وتقليل التكاليف. ومع ذلك، فإن تعقيد بيانات السجلات الصحية الإلكترونية (EHR) هي تحديا لتطبيق الت علم العميق. على وجه التحديد، تتم مراقبة البيانات التي تم إنتاجها في القبول في المستشفى من قبل نظام EHR، والذي يتضمن بيانات منظمة مثل درجة حرارة الجسم اليومية والبيانات غير المنظمة مثل النصوص المجانية والقياسات المختبرية. على الرغم من وجود بعض الأطر المعالجة المسبقة المقترحة لبيانات EHR المحددة، فإن الملاحظات السريرية التي تحتوي على قيمة سريرية كبيرة تتجاوز عالم نظرها. بالإضافة إلى ذلك، سواء كانت هذه البيانات المختلفة من وجهات النظر المختلفة هي مفيدة لجميع المهام الطبية وكيفية الاستفادة من أفضل هذه البيانات لا تزال غير واضحة. لذلك، في هذه الورقة، نقوم أولا باستخراج الملاحظات السريرية المصاحبة من EHR وتقترح طريقة لدمج هذه البيانات، كما ندرس بشكل شامل النماذج المختلفة وأساليب نفاد البيانات لتحسين أداء تنبؤ المهام الطبي بشكل أفضل. تظهر النتائج على مهام التنبؤتين أن نموذجنا المنصوص عليه مع بيانات مختلفة تتفوق على الطريقة التي من أحدثها دون ملاحظات سريرية، توضح أهمية طريقة الانصهار وميزات الملاحظات السريرية.

multimodal ehr data ehr data بيانات EHR متعددة الوسائط EHR Data. صناعة حمض الفوسفور

MSD: تقطير المعرفة الإدراجية

687 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

للحد من حجم النموذج ولكن الاحتفاظ بالأداء، كنا نعتمد في كثير من الأحيان على تقطير المعرفة (دينار كويتي) الذي ينقل المعرفة من نموذج المعلم الكبير إلى نموذج طالب أصغر. ومع ذلك، فإن KD على مجموعات بيانات متعددة الوسائط مثل مهام اللغة الرؤية غير مستكشفة نسبيا، وهضم معلومات متعددة الوسائط تحديا لأن طرائق مختلفة تقدم أنواعا مختلفة من المعلومات. في هذه الورقة، نقوم بإجراء دراسة تجريبية واسعة النطاق للتحقيق في أهمية وآثار كل طريقة في تقطير المعرفة. علاوة على ذلك، نقدم إطارا لتقطير المعرفة متعددة الوسائط، وقطاع التقطير الخاص بالطرياء (MSD)، لنقل المعرفة من المعلم عن مهام متعددة الوسائط عن طريق تعلم سلوك المعلم داخل كل طريقة. تهدف الفكرة إلى تحية التنبؤات الخاصة بنوية المعلم من خلال إدخال شروط الخسائر المساعدة لكل طريقة. علاوة على ذلك، نظرا لأن كل طريقة لها اتفاقية مختلفة بالنسبة للتنبؤات، فإننا نحدد درجات الرافية لكل طريقة وتحقيق في مخططات الترجيح القائم على الرافية للخسائر الإضافية. ندرس نهج تعليم الوزن لمعرفة الأثقال المثلى على شروط الخسارة هذه. في تحليلنا التجريبي، نقوم بفحص اتفاقية كل طريقة في KD، وأوضح فعالية نظام الترجيح في MSD، وإظهار أنه يحقق أداء أفضل من KD على أربعة مجموعات بيانات متعددة الوسائط.

saliency-aware knowledge distillation saliency-aware knowledge multimodal understanding انتقط المعرفة بالوحدة المعرفة الإدراكية فهم متعدد الوسائط صناعة حمض الفوسفور المزيد..

MTTT: تعلم تعويضات التفاعل المتعدد الوسائط من المحولات ثلاثية التريلين

1096 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

في السؤال المرئي الرد على (VQA)، تركز الأساليب الطيفة الموجودة على التفاعل بين الصور والأسئلة. نتيجة لذلك، يتم تقسيم الإجابات إلى الأسئلة أو المستخدمة كملصقات فقط للتصنيف. من ناحية أخرى، تستخدم نماذج Trilinear مثل نموذج CTI بكفاءة معلومات فيما بين ال اعتراضات بين الإجابات والأسئلة والصور، مع تجاهل معلومات المشرفة داخل العملية. مستوحاة من هذه الملاحظة، نقترح إطارا جديدا للتفاعل Trilinear يسمى Mirtt (تعلم تشكيل التفاعل المتعدد الوسائط من محولات Trilinear)، مما يشتمل على آليات الاهتمام لالتقاط علاقات الوسائط المشتركة بين الوسائط والتعديل. علاوة على ذلك، نقوم بتصميم سير عمل من مرحلتين حيث يقلل نموذج Silinear النموذج الحر، مشكلة VQA مفتوحة العضوية في مشكلة VQA متعددة الخيارات. علاوة على ذلك، للحصول على تمثيلات دقيقة وجميلة متعددة الاستخدامات، فإننا قرب ما قبل تدريب Mirtt مع التنبؤ اللغوي الملثمين. تقوم طريقةنا بتحقيق الأداء الحديث في مهمة Visual7W Task و VQA-1.0 متعددة الخيارات ومفتوحة خطوط الأساس Silinear على مجموعات بيانات VQA-2.0 و TDIUC و GQA.

السيطرة على جيل النص learning multimodal interaction multimodal interaction representations تعلم التفاعل متعدد الوسائط تمثيل التفاعل متعدد الوسائط صناعة حمض الفوسفور

Low Resource Multimodal الآلة العصبية ترجمة باللغة الإنجليزية الهندية في مجال الأخبار

803 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

إن دمج طرائق الإدخال المتعددة في نظام الترجمة الآلي (MT) يكتسب شعبية بين الباحثين MT. على عكس مجموعة البيانات المتاحة للجمهور لمهام ترجمة الآلات متعددة الوسائط، حيث تكون التسميات التوضيحية أوصاف صورة قصيرة، توفر التعليق الأخبار وصفا أكثر تفصيلا لمحتو يات الصور. نتيجة لذلك، يتم العثور على العديد من الكيانات المسماة المتعلقة بالأشخاص المحددين والمواقع وما إلى ذلك. في هذه الورقة، يكتسبان مجموعة بيانات أخبار أحادية أحادية الأبعاد التي أبلغت باللغة الإنجليزية والهندية مقترنة بالصور لتوليد كوربوس موازية من اللغة الإنجليزية الهندية الاصطناعية. يستخدم Corpus الموازي لتدريب الترجمة الآلية العصبية باللغة الإنجليزية (NMT) ونظام MMT باللغة الإنجليزية من خلال دمج ميزة الصورة المقترنة مع Corpus الموازي المقابلة. نحن أيضا إجراء تحليل منهجي لتقييم أنظمة MT الإنجليزية-الهندية مع 1) المزيد من البيانات الاصطناعية و 2) عن طريق إضافة البيانات المترجمة إلى الوراء. يؤدي النتيجة لدينا إلى تحسن من حيث درجات BLEU لكل من أنظمة NMT (+8.05) و MMT (+11.03).

low resource multimodal resource multimodal neural موارد منخفضة متعددة الوسائط الموارد متعددة الوسائط العصبية صناعة حمض الفوسفور

تجارب تكييف تقنيات الترجمة المتعددة الوسائط للهيكلية

742 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

الترجمة الآلية العصبية متعددة الوسائط (MNMT) هي مهمة مثيرة للاهتمام في معالجة اللغة الطبيعية (NLP) حيث نستخدم طرائق مرئية إلى جانب جملة مصدر لمساعدة المصدر لعملية الترجمة المستهدفة.في الآونة الأخيرة، كان هناك الكثير من الأعمال في أطر MNMT لتعزيز أداء مهام الترجمة ذات الجهاز المستقل.حاولت معظم الأعمال السابقة في MNMT إجراء الترجمة بين لغتان معروفتين على نطاق واسع (على سبيل المثال English-to-German، الإنجليزية إلى الفرنسية).في هذه الورقة، نستكشف فعالية أساليب MNMT المختلفة، والتي تستخدم تقنيات مختلفة الموجهة نحو البيانات بما في ذلك التدريب المسبق متعدد الوسائط، لغات موارد منخفضة.على الرغم من أن الأساليب الحالية تعمل بشكل جيد على لغات الموارد العالية، إلا أن قابلية استخدام تلك الأساليب على لغات الموارد المنخفضة غير معروفة.في هذه الورقة، نقيم الطرق الحالية على الهندية والإبلاغ عن نتائجنا.

adapting multimodal machine experiences of adapting تكييف آلة متعددة الوسائط تجارب التكيف صناعة حمض الفوسفور

يمكنك البدء بجني المال وتحقيق ربح مادي من أبحاثك العلمية، المزيد