بهبود بازیابی اطلاعات براساس تشابه معنایی کلمات کلیدی بااستفاده از رتبه دهی مبتنی بر گراف

  • تاریخ ثبت: 18 دی 1396
  • نویسندگان: مجید عبدالرزاق نژاد
  • کلمات کلیدی: اطلاعات آماری ، رتبه دهی مبتنی بر گراف ، کلمه کلیدی ، کلمات کلیدی استخراجی.
کلمات کلیدی در اسناد متنی ، کلماتی از متن اسنادهستند که بیشترین بار مفهومی متن را به همراه داشته و نیزیک نسخه فشرده متن محسوب می شود در نتیجه نیاز به روش های استخراج خودکار کلمات کلیدی را به شدت افزایش داده اخیرا روش های رتبه بندی مبتنی بر گراف کاربرد موفقی در حوزه وب داشته یک مشکل عمده اکثراین روش ها تاکید بیش از حد بر پارامترهم جواری کلمات در ایجاد و وزندهی یال های گراف متنی و صرف نظر از شاخص های آماری شده است . در این پژوهش برانیم شباهت معنایی کلمات کلیدی را به صورت فرمتپیچیده تری از متغیر TF-IDF )روش وزندهی کلاسیک( به عنوان شاخص آماری بیان کنیم. با تعریف متغیر جدید که بیانگر ترتیب کاهنده از احتمال ارتباطشان با پرس وجوی کاربر است و یک روش مشخص به عنوان رتبه بندی احتمال ؛ الگوریتم معروف BM25 است ، در این پژوهش اطلاعات آماری روش رتبه بندی احتمال ارتباطکلمات کلیدی، از جمله تعداد اسناد مشابه و اسناد کل مجموعه در وزندهی گراف استفاده شده است.هدف این مقاله این است که شباهت معنایی اسناد مختلف با سند مورد نظربررسی کنیم با رتبه بندی کلمات کلیدی مجموعه اسناد مرجع ، اسنادی که دارای کلمات کلیدی با بالاترین اولویت اند ، شبیه ترین اسناد به سند مورد بررسی است. مقایسه نتایج روش جدید با روش های قبلی افزایش دقت 93 %در اسناد استخراج شده مشابه سند مورد بررسی را نشان می دهد.