بحث متقدم مدعوم من الذكاء الصنعي

مساحة جديدة

اشترك بالحزمة الذهبية واحصل على وصول غير محدود شمرا أكاديميا

تسجيل مستخدم جديد

إطار تعلم التعزيز متعدد الوكلات التعاونية لتحليل إجراء الحوار

A Collaborative Multi-agent Reinforcement Learning Framework for Dialog Action Decomposition

680 0 0 0.0 ( 0 )

تحميل البحث استخدام كمرجع

نشر من قبل جمعية اللغويات الحاسوبية ACL مقالة

تاريخ النشر 2021

مجال البحث الذكاء الاصناعي

والبحث باللغة English

تمت اﻹضافة من قبل Shamra Editor

collaborative multi-agent reinforcement dialog action decomposition multi-agent reinforcement learning التعاون التعاوني متعدد الوكيل التعزيز حوار إجراء التحلل التعلم التعزيز متعدد الوكيل صناعة حمض الفوسفور

قم بزيارة صفحتنا على فيسبوك

‎Shamra Academia - شمرا أكاديميا‎

اسأل ChatGPT حول البحث

الملخص بالعربية الملخص بالإنكليزية

تقوم معظم طرق التعلم في مجال التعزيز لسياسة الحوار، قم بتدريب تعلم وكيل مركزي يختار إجراء مشترك محدد مسبقا اسم النطاق ونوع النية واسم الفتحة. يعاني وكيل الحوار المركزي من متطلبات العديد من متطلبات تفاعل المستخدمين لعمل المستخدمين بسبب مساحة العمل الكبيرة. إضافة إلى ذلك، فإن تصميم الإجراءات المتسلسلة شاقة للمهندسين وربما كافح مع حالات الحافة. لحل هذه المشاكل، نقوم بنمط مشكلة تعلم سياسة الحوار مع إطار جديد متعدد الوكلاء، حيث يقود كل جزء من الإجراء من قبل وكيل مختلف. الإطار يقلل من تكاليف العمل لقوالب الإجراءات ويقلل من حجم مساحة العمل لكل وكيل. علاوة على ذلك، نقوم بتخفيف المشكلة غير الثابتة الناجمة عن ديناميات البيئة المتغيرة كتطور سياسات الوكلاء من خلال إدخال عملية تحسين مشتركة تجعل الوكلاء يمكنهم تبادل معلومات سياستهم. في الوقت نفسه، يتم دمج آلية إعادة تشغيل تجربة مخزنة مستقلة لتقليل الاعتماد بين تدرجات العينات لتحسين كفاءة التدريب. يتم إثبات فعالية الإطار المقترح في بيئة متعددة المجالات مع كل من تقييم محاكي المستخدم والتقييم البشري.

المراجع المستخدمة

https://aclanthology.org/

قيم البحث

734 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

تهدف التصنيف متعدد الوسائط واسع النطاق إلى التمييز بين مختلف البيانات متعددة الوسائط، وقد لفت الانتباه بشكل كبير منذ العقد الماضي. في هذه الورقة، نقترح إطارا متعدد المهام في مجال التعلم لمهمة التصنيف المتعدد الوسائط، والتي تتكون من فرعين: فرع متعدد ا لأضوانات متعدد الوسائط وفرع النمذجة متعددة الوسائط المستنتيت بالاهتمام. يمكن أن يتلقى AutoNcoder متعدد الوسائط ميزات متعددة الوسائط والحصول على المعلومات التفاعلية التي تسمى ميزة التشفير متعددة الوسائط، واستخدام هذه الميزة لإعادة تكوين جميع بيانات الإدخال. بالإضافة إلى ذلك، يمكن استخدام ميزة التشفير المتعددة مشروط لإثراء بيانات DataSet RAW، وتحسين أداء مهام المصب (مثل مهمة التصنيف). أما بالنسبة لفرع النمذجة المتعددة الأبعاد القائم على الانتباه، فإننا نوصي أولا آلية الاهتمام لجعل النموذج يركز على الميزات المهمة، ثم نستخدم ميزة التشفير متعددة الوسائط لإثراء معلومات الإدخال، وتحقيق أداء أفضل. نقوم بإجراء تجارب مكثفة على مجموعة بيانات مختلفة، توضح النتائج فعالية الإطار المقترح.

multi task learning learning based framework task learning based التعلم المهمة المتعددة التعلم القائمة على الإطار التعلم المهمة القائمة صناعة حمض الفوسفور المزيد..

تعلم تعلم مربع الحوار نهاية موجهة نحو الأهداف من مهام الحوار ذات الصلة

691 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

لكل مهمة حوار موجهة نحو تحقيق الأهداف ذات أهمية، يجب جمع كميات كبيرة من البيانات للحصول على التعلم المنتهي للنظام الحوار العصبي.جمع هذه البيانات هي عملية مكلفة وتستغرق وقتا طويلا.بدلا من ذلك، نوضح أنه يمكننا استخدام كمية صغيرة فقط من البيانات، والتي تستكمل البيانات من مهمة حوار ذات صلة.فشل التعلم بسذاجة من البيانات ذات الصلة في تحسين الأداء لأن البيانات ذات الصلة يمكن أن تكون غير متسقة مع المهمة المستهدفة.نحن نصف طريقة تعتمد على التعلم التعريفي والتي تتعلم بشكل انتقائي من بيانات مهمة الحوار ذات الصلة.نهجنا يؤدي إلى تحسينات بدقة كبيرة في مهمة الحوار مثال.

dialog task related dialog task مهمة الحوار مهمة الحوار ذات الصلة صناعة حمض الفوسفور

Rewardsofsum: استكشاف مكافآت التعزيز التعزيز للحصول على التوصيل

573 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

حتى الآن، اعتمدت معظم نماذج التلخيص المذهلة على متغيرات من احتمال السجل السلبي (NLL) كهدف تدريبهم. في بعض الحالات، تمت إضافة التعلم التعزيز لتدريب النماذج بهدف أقرب إلى تدابير التقييم الخاصة بهم (مثل Rouge). ومع ذلك، فإن وظيفة المكافآت التي سيتم استخ دامها في نهج التعلم التعزيز يمكن أن تلعب دورا رئيسيا للأداء ولا يزال غير مستكشفة جزئيا. لهذا السبب، في هذه الورقة، نقترح اثنين من وظائف المكافأة لمهمة التلخيص الجماعي: الوظيفة الأولى، المشار إليها باسم RWB-Hinge، يختار ديناميكيا العينات لتحديث التدرج. الوظيفة الثانية، الملقب بالمخاطر، يرفع مجموعة صغيرة من المرشحين القويين لإبلاغ المكافأة. في التجارب، نجري النهج المقترح من خلال ضبط النموذج المدرب مسبقا من NLL أكثر من تسع مجموعات بيانات ملخصة من الحجم والطبيعة المتنوعة. تظهر النتائج التجريبية تحسنا ثابتا على خطوط خطوط الأساسيات المحدودة السلبية.

exploring reinforcement learning exploring reinforcement reinforcement learning rewards استكشاف التعزيز التعلم استكشاف التعزيز مكافآت التعزيز التعزيز صناعة حمض الفوسفور المزيد..

إطار تعليمي ثلاث مراحل لتوليد الحوار المعرفي المنخفض

611 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

أظهرت نماذج المحادثة العصبية إمكانات كبيرة تجاه توليد ردود بطلاقة وإمعلومات عن طريق إدخال معرفة خلفية خارجية. ومع ذلك، فمن الشائع بناء هذه الحوارات المدرجة في المعرفة، وعادة ما تؤدي النماذج الحالية بشكل سيء عند النقل إلى مجالات جديدة مع عينات تدريب م حدودة. لذلك، فإن بناء نظام حوار مدرج في المعرفة بموجب إعداد الموارد المنخفضة هو قضية حاسمة لا تزال. في هذه الورقة، نقترح إطارا لتعليم تعليمي رواية ثلاث مراحل يستند إلى التعلم الإشرافه ضعيف يفيد من الحوارات على نطاق واسع وقاعدة المعرفة غير المنظمة. للتعاون بشكل أفضل مع هذا الإطار، نضع متغير من المحولات مع فك فك التشفير التي تسهل التعلم المنطلق لتوليد الاستجابة وإدماج المعرفة. تشير نتائج التقييم إلى معيارين إلى أن نهجنا يمكن أن يتفوق على أساليب حديثة أخرى مع بيانات تدريب أقل، وحتى في سيناريو الموارد الصفرية، فإن نهجنا لا يزال ينفذ جيدا.

three-stage learning framework knowledge-grounded dialogue إطار تعليمي ثلاث مراحل حوار المعرفة صناعة حمض الفوسفور

عازلة: تعلم سياسة الحوار الخاضعة للإشراف ضعيف: تقدير المكافآت للحوار متعدد الدوران

1005 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

لا ينبغي أن يؤدي نظام الحوار الذكي في إعداد متعدد المنعطف إلى إنشاء الاستجابات فقط من نوعية جيدة، ولكن يجب أن تولد أيضا الردود التي يمكن أن تؤدي إلى نجاح طويل الأجل للحوار. على الرغم من أن الأساليب الحالية تحسنت جودة الاستجابة، إلا أنها تنظر إلى الإش ارات التدريبية الموجودة في بيانات الحوار. يمكننا الاستفادة من هذه الإشارات لتوليد بيانات التدريب الإشراف ضعيف لسياسة حوار التعلم ومقدر المكافآت، وجعل السياسة تتخذ إجراءات (يولد الردود) التي يمكن أن تتوقع الاتجاه المستقبلي للمحادثة الناجحة (مكافأة). نحاكي الحوار بين وكيل ومستخدم (على غرار وكيل مع هدف التعلم الخاضع للإشراف) للتفاعل مع بعضها البعض. يستخدم الوكيل حدودا ديناميكيا لإنشاء ردود متنوعة في المرتبة واستغلال الاستكشاف لتحديد عدد الردود الأعلى. يتم تقييم كل زوج عمل محاكي لحالة الدولة (يعمل كشروح ضعيفة) مع ثلاث وحدات الجودة: الدلالي ذات الصلة والتماسك الدلالي وتدفق متسق. تشير الدراسات التجريبية التي لديها معيارين إلى أن طرازنا يمكن أن نفذت بشكل كبير جودة الاستجابة وتؤدي إلى محادثة ناجحة على كل من التقييم التلقائي والحكم البشري.

reward estimation weakly supervised dialogue supervised dialogue policy تقدير المكافأة الحوار الخاضع للإشراف سياسة الحوار الخاضعة للإشراف صناعة حمض الفوسفور المزيد..

الأسئلة المقترحة

شرح تقنية التعرف على الصوت Voice Recognition

2110 - 0 - - تم طرحه بمساحة (الذكاء الاصناعي)

التعرف على الصوت التعرف على الكلام التعرف على الكلام التلقائي

سجل دخول لتتمكن من نشر تعليقات

التعليقات

جاري جلب التعليقات

سجل دخول لتتمكن من متابعة معايير البحث التي قمت باختيارها

معهد تكنولوجيا المعلومات ITI

تفاصيل إضافية المزيد من الجامعات

يمكنك البدء بجني المال وتحقيق ربح مادي من أبحاثك العلمية، المزيد

إطار تعلم التعزيز متعدد الوكلات التعاونية لتحليل إجراء الحوار

A Collaborative Multi-agent Reinforcement Learning Framework for Dialog Action Decomposition

اسأل ChatGPT حول البحث

اقرأ أيضاً

الأسئلة المقترحة