الفريق العربي للبرمجةأرشيف المنتديات · 2000 – 2023
نسخة أرشيفية للقراءة فقط — التسجيل والمشاركة مغلقان، والمحتوى محفوظ كما كان.

Information Retrival

بدأه محمد نجيب2 في 28 ديسمبر 2009 · 7 رد · 1,621 مشاهدة · في الذكاء الاصطناعي وتطبيقاته
مشاركة: واتساب X فيسبوك تيليجرام
#1 صاحب الموضوع

السلام عليكم انا طالب سنة خامسة معلوماتية مشروعي النخرج هو محرك بحت باللغة العربية يستخدم خوارزمية lsa,svd واللذان يقوما باختصار المعلومات المعادة والتي شرحها باللغة الانكليزية هي في الملف المرفق

الرجاء المساعدة وشكرا.

#2

السلام عليكم ورحمة الله وبركاته ........

اخي انت قمت بنفس الطلب مرتيين وفي موقعين مختلفين , ما هو السبب من ذالك!! الله اعلم , على كل ارفقت ملف تستطيع ان تستفيد منه واتمنى في المرات القادمة ان تكون مشاركاتك مدعمه بعمل انت قمت به لكي نشاركك بها بارك الله فيك , كما وانه اصلا لا يوجد اي ملف انت قمت بارفاقه في مشاركتك وايظا لم تستخدم خاصية البحث لانه يوجد شروحات لهذا الموضوع في المنتديات ...

لا اريد ان اغلق الموضوع بل اكتفي بتنبيهك لذالك الامر ... بارك الله فيك

تحياتي

AI-IR.rar

#3

ممكن اشرحلك ال vector space model اذا كانت حتفيدك

لكن خذ مني الوصول لحل يحقق نجاح بنسبة 70 % في ارجاع الكلمات لجذورها (arabic stemming) بحد ذاته انجاز

Unix is user friendly. It's just selective about who its friends are .

#4

السلام عليكم ورحمة الله وبركاته .........

EZ.ELDEEN كتب:

ممكن اشرحلك ال vector space model اذا كانت حتفيدك

لكن خذ مني الوصول لحل يحقق نجاح بنسبة 70 % في ارجاع الكلمات لجذورها (arabic stemming) بحد ذاته انجاز

احسنت بمقاييس النتائج عندما تكون النسبه اعلى من خمسين تكون جيده وكما قلت انجاز ,,,

اما بالنسبه لفكرة شرحك لها ففعل الخير اخي لا يحتاج لمشوره , اشرحها اخي ونحن سسنشاركك بارك الله فيك .... واجعلها بموضوع منفرد لكي لا تضيع داخل المشاركات لعلنا نخرج بنتائج جيده ونطورها مع بعضنا البعض ونطبقها عمليا .....

بانتظارك ان شاء الله ...

تم تعديل هذه المشاركة بواسطة hassan_82 في 28 ديسمبر 2009 في 15:35

#5

السلام عليكم عذرأ من ادارة المنتدى لانني وضعت الموضوع في مكانين مختلفين لانني لم اعرف هذا البحث اين يصنف المشروع هو محرك بحث عربي يستخدم خوارزميات LSA+SVDحيث نقوم بتشكيل مصفوفة اعمدتها هي الوثائق واسطرها هي الكلمات الموجودة في الوثائق وهنا ينتج لدينا مصوفة كبيرة الابعاد حيث نقوم بتخفيضها بواسطة SVD ومن ثم نقارن querey المدخل مع المصفوفة فالرجاء المساعة وشكرأ.

#6

ان شاء الله ساقوم بشرحهابعد انتهائي من الامتحانات

--

اخ محمد في اتخاذ المصفوفات وسيلة لتخزين البيانات الخاصة بك سيتسبب بحجز كم هائل من الذاكرة دون جدوى

يفضل ان تستخدم data structure معين ك vectors مثلا لتخزين ال documents و ال terms الخاصة ب كل document (بعد اجراء عملية ال stemming و حذف ال stop words )ثم تخزن الناتج و يفضل انك تستخدم serialization حتى توفر وقت اعادة تحميل البيانات في حال اعادة حساب ال term frequency و ال document frequency

لان هذه العملية لن تتم على ال documents الا مرة واحدة فقط الا في حال حدوث تغيرات في محتواها ..

لي عودة ..

Unix is user friendly. It's just selective about who its friends are .

#7

السلام عليكم ياأخي من غزة المحاصرة فك الله عليها الحصار ان شاء الله انا بدي استخدم LsA ,SVD من اجل تخفيض ابعاد المصفوفة الرجاء المساعدة في اسرع وقت ممكن والسلام عليكم .

#8

بعد اجراء عملية ال stemming و حذف ال stop words وال delimeters

طبعا رح تعمل weighting

ثم Normalization

وهي الأهم لأنه يعمل على أن يكون هناك عداله fairness في تمثيل الكلمات terms في الوثائق documents في فضاء المحاور vector space

مما يحسن فرصة استرجاع هذه الوثائق اللتي تحتوي هذه الكلمات (أقولها لك بشكل مبسط كأنك تقوم بعملية توحيد المقامات للكسور في الرياضيات)

وقد أثبتت الدراسات في أنه كل ما ذكره الأخوه من stemming و حذف ال stop words وال delimiters وعملية ال

Normalization

كل هذه العمليات او مايسمى بعمليات المعالجة الإستباقية pre -processing techniques تنقص من حجم index او حجم ال concordance بنسبة 40% وهي نسبة ممتازة للتخفيف من كلفة المعالجة

الكونكوردنس concordance طبعا فقط في حالة تمثيل الTerm or word in document بشكل ثنائي binary 0 or 1 وهو سهل 0 يعني الكلمه غير موجوده في تلك ال وثيقه والعكس صحيح .

ولكن إستخدام الإندكس index افضل جوده كونه يستخدم قيم عدديه وليست ثنائيه وهو المستخدم حاليا في محركات البحث العملاقه ونظم استرجاع المعلومات اليوم !

طبعا كل ماذكر يسمى Information retrieval system

اما محرك البحث search engine فهو عباره عن أداة Tool تستخدم Information Retrieval لمقارنة الإستعلام Query مثلا بنحط كلمات في اي محرك بحث ويروح يدور في IR

اي الفهرس = Indexed corpus

وهنا تأتي عدة عوامل منها

1- ماذكرت من خوارزميات للبحث وتمييز الأنماط

2- type of data structure to represent Indexes

3- تنا the optimal use of ranking methods

4- تتا the use of query expansion methods

5- وهناك عدة طرق تدعم كفاءة محركات البحث مثل التصنيف والتلخيص وممكن...... أشياء أكثر..

6- تتا the step of processing Distribution

فالعمل ليس بالسهل وليس بالمستحيل ولكن يتطلب جهد جبار ودعم مادي .

ومشوار الألف ميل يبدأ بميل........! كقوقل مثلا بدأت بفكرة اثنين والآن يتكلمون بالمليارات.

الله يفك حصاركم ياأهل غزة هاشم............ ويوفقنا لنصرتكم بما نستطيع

ملاحظة :

ممكن الإستفادة كثيرا من هذا الكتاب بس افتح الرابط واضغط على جملة request download Ticket

Natural Language Processing for Online Applications: Text retrieval, extraction and categorization - Second revised edition (Natural Language Processing)

ولكي تفك الملف المضغوط هذه كلمة السر ممكن يكون هناك حرف مسافه قبلهاgigle.ws

archive password: gigle.ws

تم تعديل هذه المشاركة بواسطة عبدالله المختار في 12 يناير 2010 في 22:09

لك الحمد(يالله) حمدا أستلذ به ذكرا

وإن كنت لا أحصي ثناءً و لاشكرا

لك الحمد مقروناً بشكرك دائما

لك الحمد في الأولى

لك الحمد في الأخرى.

مواضيع مشابهة