• شماره ركورد
    1352378
  • عنوان مقاله

    كاربست قوانين انجمني و خوشه‌بندي در كنترل كيفيت داده‌هاي پژوهشي مورد مطالعه: پايگاه اطلاعات علمي ايران (گنج)

  • پديد آورندگان

    فخرزاده ، آزاده پژوهشگاه علوم و فناوري اطلاعات ايران (ايرانداك) , ارشادي ، محمد جواد پژوهشگاه علوم و فناوري اطلاعات ايران (ايرانداك) , ارشادي ، محمد مهدي دانشگاه صنعتي اميركبير

  • از صفحه
    927
  • تا صفحه
    944
  • كليدواژه
    كيفيت داده , كيفيت اطلاعات پژوهشي , كنترل كيفيت , داده‌كاوي
  • چكيده فارسي
    پايگاه‌هاي اطلاعات علمي و موتورهاي جست‌وجو از ابزارهاي اصلي كار پژوهشگران است. براي بازيابي دقيق و صحيح اطلاعات از اين پايگاه‌ها نياز است كه اطلاعات با كيفيت مناسب و با كمترين خطا ذخيره شود. كنترل دستي اطلاعات زمان‌بر و پُرهزينه است. در اين مقاله، روش‌هاي داده‌كاوي براي كنترل كيفيت پايگاه اطلاعات پژوهشي معرفي مي‌شود. براي اين منظور، ابتدا بايد اطلاعاتي از خطاهاي مرسوم را در كنار ساير اطلاعات هر ركورد جمع‌آوري كرد. سپس، با استفاده از روش‌هاي داده‌كاوي الگوهاي پنهان و روابط بين خطاها را كشف كرد و بر اين اساس، راه‌هاي بهبود كيفيت داده را ارائه داد. در اين مقاله پايگاه اطلاعات علمي ايران (گنج)، به‌عنوان مطالعه‌ موردي در نظر گرفته شد. 59 كد خطا توسط خبرگان تعريف شد. سپس، اطلاعات فراداده‌ هر ركورد مثل نام دانشگاه، نام رشته،گرايش و حوزه‌ تخصصي مدرك به ‌همراه كدهاي خطاي آن در يك مجموعه داده ‌ذخيره شد. اين مجموعه داده شامل 41021‌ ركورد ‌در حوزه‌هاي مختلف است. با استفاده از روش‌هاي آماري و قوانين انجمني رابطه بين خطاها و الگوي تكرار آن‌ها درهر حوزه بررسي شد. نتايج نشان داد كه ‌به‌طور ميانگين با در نظر گرفتن 25 درصد از خطاها در هر حوزه، مي‌توان تا 80 درصد از خطاهاي همه‌ ركوردهاي يك حوزه را كاهش داد. اين خطاها شامل خطاهاي پرتكرار در هر حوزه و همچنين خطاهايي است كه با آن‌ها رابطه‌ قوي دارند. با استفاده از روش خو‌شه‌بندي k-means ركوردها خوشه‌بندي شدند. نتايج نشان داد كه اگرچه شباهت‌هايي بين ركوردها از حوزه‌هاي مختلف وجود دارد، اما رابطه‌ معناداري بين حوزه‌ ركوردها و الگوي تكرار خطاها وجود ندارد.
  • عنوان نشريه
    پژوهش نامه پردازش و مديريت اطلاعات
  • عنوان نشريه
    پژوهش نامه پردازش و مديريت اطلاعات