أوراق بحثية, رسائل ماجستير ودكتوراه حول word

تعلم كلمة أساسية تعني التمثيلات على الرسوم البيانية التشابه

1101 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

تقدم هذه الورقة نهجا جديدا للتعلم بزيادة المعنى بصريا تمثيل الكلمات باعتبارها تضمين عقدة منخفضة الأبعاد في التسلسل الهرمي في الرسم البياني الأساسي.المستوى الأدنى من عروض الكلمات التسلسل الهرمية الخاصة بالكلمة، مشروط إلى طريقة أخرى، من خلال الرسوم الب يانية المخصصة ولكن التواصل، في حين أن المستوى الأعلى يضع هذه التمثيلات معا على رسم بياني واحد لمعرفة التمثيل بالاشتراك من كل من الطرائق.طوبولوجيا كل طرازات الرسم البياني علاقات التشابه بين الكلمات، ويقدر بالاشتراك مع تضمين الرسم البياني.الافتراض الأساسي هذا النموذج هو أن الكلمات تقاسم معنى مماثل تتوافق مع المجتمعات في الرسم البياني الأساسي في مساحة منخفضة الأبعاد.لقد سمحنا على هذا النموذج التسلسل الهرمي تشابه الرسم البياني متعدد الوسائط (HM-SGE).تحقق النتائج التجريبية من صحة قدرة HM-SGE لمحاكاة أحكام التشابه البشري وتصنيف المفهوم، مما يتفوق على حالة الفن.

learning grounded word grounded meaning representations learning grounded تعلم الكلمة المحددة تعني المعنى المحدد تعلم الأساس صناعة حمض الفوسفور المزيد..

الاستفادة من المعرفة تكوين الكلمة ل disambigation الكلمة الصينية

895 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

في لغات parataxis مثل الصينية، يتم بناء معاني الكلمات باستخدام تكوينات كلمات محددة، والتي يمكن أن تساعد في إزالة حواس الكلمات.ومع ذلك، نادرا ما يتم استكشاف هذه المعرفة في أساليب Disambiguation Sense (WSD) السابقة.في هذه الورقة، نقترح نفايات المعرفة ب تكوين النصوص لتعزيز WSD الصيني.نحن أولا بناء مجموعة بيانات WSD الصينية على نطاق واسع مع تكوينات الكلمات.بعد ذلك، نقترح نموذج صيغة نموذجية لإدماج تكوين الكلمات بشكل صريح في حالة إزالة الغموض.لتعزيز التعميم، نقوم بتصميم وحدة تنقية تكوين كلمة في حالة تعويض تكوين كلمة غير متوفرة.تظهر النتائج التجريبية أن طريقتنا تجلب تحسن كبير في الأداء على خطوط خطوط خطوط خطوط طويلة.

ذاكرة chinese word sense كلمة الصينية المعنى صناعة حمض الفوسفور

BAHP: معيار تقييم كلمة Adgeddings باللغة البرتغالية التاريخية

575 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

نماذج توزيع عالية الجودة يمكن التقاط العلاقات المعجمية والدلالية بين الكلمات.وبالتالي، يقوم الباحثون بتصميم مختلف المهام الجوهرية لاختبار ما إذا كانت هذه العلاقات يتم القبض عليها.ومع ذلك، فإن معظم المهام الجوهرية مصممة للغات الحديثة، وهناك نقص في طرق التقييم للنماذج التوزيعية للشرج التاريخي.في هذه الورقة، أجرينا BAHP: معيارا لتقييم Adgeddings Word باللغة البرتغالية التاريخية، والذي يحتوي على أربعة أنواع من الاختبارات: التشابه، التشابه، والكشف التفويض، والتماسك.درسنا نماذج Word2Vec الناتجة عن اثنين من البرتغالية التاريخية في مجموعات الاختبار الأربعة هذه.توضح النتائج أن مجموعات الاختبار الخاصة بنا قادرة على قياس جودة نماذج مساحة المتجهات ويمكن أن توفر وجهة نظر شاملة لقدرة النموذج على التقاط معلومات النحوية والدلامة.علاوة على ذلك، يمكن بسهولة امتدت منهجية إنشاء مجموعات الاختبار الخاصة بنا إلى لغات تاريخية أخرى.

assessing word embeddings assessing word تقييم كلمة embeddings. تقييم الكلمة صناعة حمض الفوسفور

لا تهمل اللغات ذات الصلة: حالة المنخفضة الموارد OCCITAN الكلمات المتبقية

519 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

أثبتت تضيير Word عبر اللغات (CLWES) لا غنى عنها لمختلف مهام معالجة اللغة الطبيعية، على سبيل المثال، تحريض معجم ثنائي اللغة (BLI). ومع ذلك، فإن عدم وجود البيانات غالبا ما يضعف جودة التمثيلات. اقترحت النهج المختلفة التي تتطلب إشراف ضعيف متصلي فقط، لكن الأساليب الحالية لا تزال تفشل في تعلم الأسطر الجيدة لغات فقط من كائن أحادي الأحادي الصغيرة فقط. لذلك ندعي أنه من الضروري استكشاف المزيد من البيانات الخاصة بتحسين CLWES في إعدادات الموارد المنخفضة. في هذه الورقة نقترح دمج بيانات لغات الموارد ذات الصلة ذات الصلة. على النقيض من الأساليب السابقة التي تنفذ بشكل مستقل تدريبا مسبقا من أجل تضمين اللغات، فإننا (1) قطار القطار للموارد المنخفضة ولغة ذات صلة بالاشتراك و (2) تعيينها إلى اللغة المستهدفة لبناء الفضاء النهائي متعدد اللغات. في تجاربنا نركز على Occitan، وهي لغة رومانسية منخفضة الموارد التي غالبا ما يتم إهمالها بسبب نقص الموارد. نستفيد من البيانات من الفرنسية والإسبانية والكانتالانية للتدريب والتقييم في مهمة Occitan-English BLI. من خلال دمج اللغات الداعمة طريقتنا التي تتفوقت على النهج السابقة بهامش كبير. علاوة على ذلك، يوضح تحليلنا أن درجة الرعاية بين لغة مدمجة ولغة الموارد المنخفضة مهمة للغاية.

تجميع المفردات أحادية الأونلينغ occitan cross-lingual word Occitan كلمة Lingual صناعة حمض الفوسفور

تدريب Levenshtein لتقدير الجودة على مستوى الكلمات

657 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

نقترح نظام رواية لاستخدام محول Levenshtein لأداء مهمة تقدير جودة مستوى Word.محول Levenshtein هو مناسب طبيعي لهذه المهمة: تم تدريبه على إجراء فك التشفير بطريقة تكرارية، يمكن لمحول Levenshtein أن يتعلم النشر بعد تحرير دون إشراف صريح.لزيادة تقليل عدم ال تطابق بين مهمة الترجمة ومهمة QE على مستوى الكلمة، نقترح إجراء تعلم نقل من مرحلتين على كل من البيانات المعززة وبيانات ما بعد التحرير البشري.نقترح أيضا الاستدلال لبناء ملصقات مرجعية متوافقة مع Finetuning على مستوى الكلمات الفرعية والاستدلال.النتائج على مجموعة بيانات المهام المشتركة WMT 2020 تشاركت إلى أن طريقةنا المقترحة لها كفاءة بيانات فائقة تحت الإعداد المقيد للبيانات والأداء التنافسي تحت الإعداد غير المقيد.

word-level quality estimation levenshtein transformer تقدير الجودة على مستوى الكلمات محول Levenshtein صناعة حمض الفوسفور

تعيين مشاكل كلمة الاحتمالية للتمثيل القابل للتنفيذ

971 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

في حين أن حل مشاكل كلمة الرياضيات تلقائيا تلقى اهتماما كبيرا في مجتمع NLP، فقد عالجت القليل من الأعمال مشاكل كلمة الاحتمالية على وجه التحديد.في هذه الورقة، نحن نوظف وتحليل النماذج العصبية المختلفة للإجابة على مشاكل هذه الكلمة.في نهج من خطوتين، يتم تع يين نص المشكلة أولا إلى تمثيل رسمي في لغة إعلانية باستخدام نموذج تسلسل إلى تسلسل، ثم يتم تنفيذ التمثيل الناتج باستخدام نظام برمجة احتمالية لتوفير الإجابة.يشتمل طرازنا الأفضل الأداء على تمثيلات الكلمات العامة في مجال العمل العام الذي تم تصويره باستخدام التعلم عبر مجموعة بيانات داخل المجال الأخرى.ونحن نطبق أيضا النماذج الطرفية إلى هذه المهمة، والتي تبرز أهمية النهج من خطوتين في الحصول على حلول صحيحة لمشاكل الاحتمال.

mapping probability word probability word problems word problems رسم خرائط كلمة احتمال مشاكل كلمة مشاكل الكلمات صناعة حمض الفوسفور المزيد..

AM2ICO: تقييم معنى الكلمات في السياق عبر لغات الموارد المنخفضة مع أمثلة الخصومة

940 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

إن التقاط معنى كلمة في السياق والتمييز بين المراسلات والاختلافات عبر اللغات هو مفتاح بناء نماذج تمثيل نصية متعددة اللغات والنجاح. ومع ذلك، فإن مجموعات بيانات التقييم المتعددة اللغات الحالية التي تقيم الدلالات المعجمية في السياق "لها قيود مختلفة. على وجه الخصوص، 1) تقتصر تغطيتها اللغوية على لغات الموارد العالية والانحساج لصالح سوى عدد قليل من الأسر والمناطق اللغوية، 2) تصميم يجعل المهمة قابلة للحل عبر الإشارات السطحية، والتي تؤدي إلى تضخم بشكل مصطنع (وأحيانا سوبر -Human) عروض التشفير المحددين، و 3) لا يوجد دعم للتقييم المتبادل اللغوي. من أجل معالجة هذه الثغرات، نقدم AM2ICO (المعنى الخصومة والتعدد اللغات في السياق)، مجموعة التقييم الواسع التغطية واللغات متعددة اللغات؛ يهدف إلى تقييم إدراج قدرة نماذج التمثيل الحديثة (SOTA) لفهم هوية معنى الكلمات في السياقات المتبادلة لمدة 14 أزواج لغوية. نقوم بإجراء سلسلة من التجارب في مجموعة واسعة من الإعدادات وإظهار الطبيعة الصعبة ل AM2ICO. تكشف النتائج أن تشفير سوتا الحالية التي يتعامل معها يتخلف بشكل كبير وراء الأداء البشري، ويتم ملاحظة أكبر فجوات لغات الموارد المنخفضة ولغات مختلفة عن اللغة الإنجليزية.

evaluating word meaning word meaning evaluating word تقييم معنى كلمة معنى الكلمة صناعة حمض الفوسفور

WMDECompose: إطارا للاستفادة من الخصائص القابلة للتفسير لمسافة Word Mover في التحليل الاجتماعي الثقافي

464 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

على الرغم من أن شعبية متزايدة من NLP في العلوم الإنسانية والعلوم الاجتماعية، فقد ترافق التقدم في الأداء النموذجي وتعقيد مخاوف بشأن التفسير والسلطة التوضيحية للتحليل الاجتماعي الثقافي. نموذج شعبي واحد يأخذ طريقا وسط مسافة كلمة المحرك (WMD). يتم تكييفه ا ظاهريا لتفسيرها، ومع ذلك تم استخدام WMD وتم تطويره بشكل أكبر بطرق تجاهل الجانب الأكثر تفسيرا في كثير من الأحيان: أي مسافات مستوى الكلمات المطلوبة لترجمة مجموعة من الكلمات إلى مجموعة أخرى من الكلمات. لمعالجة هذه الفجوة الواضحة، نقدم WMDECOMPOOPE: مكتبة نموذجية ومكتبة بيثون 1) تتحلل مسافات مستوى المستند في المسافات في مستوياتها المكونة على مستوى الكلمات، و 2) مجموعات في وقت لاحق من تحفيز العناصر المواضيعية، بحيث يتم الاحتفاظ بالمعلومات المعجمية المفيدة تلخيص للتحليل. لتوضيح إمكاناتها في سياق علمي اجتماعي، نطبقها على جثة وسائل التواصل الاجتماعي الطولية لاستكشاف العلاقة المتبادلة بين نظريات المؤامرة والأحرفات الأمريكية المحافظة. أخيرا، نظرا لتعقيد الوقت الكامل في الوقت الحالي، فإننا نقترح بالإضافة إلى طريقة لأخذ عينات من مجموعات البيانات الكبيرة بطريقة استنساخ، مع حدود ضيقة تمنع استقراء النتائج غير الموثوقة بسبب سوء أخذ العينات الممارسات.

framework for leveraging word mover distance sociocultural analysis إطار للاستفادة كلمة المحرك المسافة التحليل الاجتماعي الثقافي صناعة حمض الفوسفور المزيد..

التعلم السياقية الكلمات المتبقية الكلمة ومحاذاة لغات الموارد المنخفضة للغاية باستخدام Corpora الموازي

779 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

نقترح نهجا جديدا لتعلم تضمين الكلمات المتبادلة عبر السياق بناء على كائن مواز صغير (E.G. بضع مئات من أزواج الجملة). تتمتع طريقتنا بدمج الكلمات عبر نموذج فك تشفير LSTM يترجم في وقت واحد وإعادة بناء جملة مدخلات. من خلال تقاسم المعلمات النموذجية بين لغات مختلفة، يدرك نموذجنا بشكل مشترك كلمة تضمين الكلمة في مساحة شائعة تبادل اللغات. نقترح أيضا الجمع بين وظائف الكلمة والكلمات الفرعية للاستفادة من أوجه التشابه الهجري عبر لغات مختلفة. نحن نؤدي تجاربنا على بيانات العالم الحقيقي من اللغات المهددة بالانقراض، وهي يونغينغ نا، Shipibo-Konibo، و Griko. تجاربنا على تحيزي المعجم الثنائي اللغة ومهام محاذاة الكلمات تظهر أن نموذجنا يفوق على الأساليب الحالية من قبل هامش كبير لمعظم أزواج اللغات. توضح هذه النتائج أنه على خلاف المعتقد الشائع، فإن نموذج الترجمة المشترك - ترميز الترميز مفيد لتعلم التمثيلات المتبادلة حتى في ظروف الموارد المنخفضة للغاية. علاوة على ذلك، يعمل نموذجنا أيضا بشكل جيد في ظروف الموارد العالية، وتحقيق الأداء الحديث في مهمة محاذاة الكلمة باللغة الألمانية.

learning contextualised cross-lingual contextualised cross-lingual word تعلم السياق عبر اللغات الكلمة التبادلية السياقية صناعة حمض الفوسفور

استخراج المواضيع مع الرسوم البيانية الوصية المتزامنة واللوانية الدلالية: النمذجة النمذجة العصبية للنصوص القصيرة

952 - جمعية اللغويات الحاسوبية ACL 2021 مقالة

أصبح نص قصير في الوقت الحاضر أشكالا أكثر عصرية من البيانات النصية، على سبيل المثال، منشورات Twitter، عناوين الأخبار ومراجعات المنتجات. يلعب استخراج الموضوعات الدلالية من النصوص القصيرة دورا مهما في مجموعة واسعة من تطبيقات NLP، ومصمم الموضوع العصبي ال آن أداة رئيسية لتحقيقها. بدافع من تعلم موضوعات أكثر متماسكا ودلاليا، في هذه الورقة نطور نموذج موضوع عصبي رواية يدعى طراز موضوع الرسم البياني المزدوج Word (DWGTM)، والذي يستخرج الموضوعات من الرسوم البيانية المرتبطة بالكلمة المتزامنة وترابط العلاقة الدلالية. لتكون محددة، نتعلم ميزات كلمة من الرسم البياني العالمي للكلمة المشتركة، وذلك لاستيعاب معلومات حدوث كلمة غنية؛ ثم نقوم بإنشاء ميزات نصية مع ميزات Word، وإطعامها في شبكة تشفير للحصول على نسب موضوعية لكل نص؛ أخيرا، نعيد إعادة بناء الرسوم البيانية الرسمية والكلمات الرسم البياني مع التوزيعات الموضعية وميزات Word، على التوالي. بالإضافة إلى ذلك، لالتقاط دلالات الكلمات، نقوم أيضا بتطبيق ميزات Word لإعادة بناء الرسم البياني للعلاقة الدلالية كلمة محسوبة بواسطة Adgeddings المدربة للكلمة المدربة مسبقا. بناء على هذه الأفكار، نقوم بصياغة DWGTM في نموذج الترميز التلقائي وتدريبه بكفاءة مع روح الاستدلال التباين العصبي. تتحقق النتائج التجريبية التي يمكنها توليد DWGTM موضوعات أكثر متماسكة من النماذج الأساسية من طرازات موضوع الأساس.

المعرفة المحقونة اللغة المدربة مسبقا simultaneous word co-occurrence semantic correlation graphs كلمة في وقت واحد التعاون الرسوم البيانية العلاقة الدلالية صناعة حمض الفوسفور

يمكنك البدء بجني المال وتحقيق ربح مادي من أبحاثك العلمية، المزيد