الفريق العربي للبرمجةأرشيف المنتديات · 2000 – 2023
نسخة أرشيفية للقراءة فقط — التسجيل والمشاركة مغلقان، والمحتوى محفوظ كما كان.

file languge

بدأه محمد1991 في 28 مارس 2012 · 5 رد · 531 مشاهدة · في JavaSE
مشاركة: واتساب X فيسبوك تيليجرام
#1 صاحب الموضوع

السلام عليكم ورحمة الله وبركاته

اريد قراءة ملف بواسطة الجافا وتحد اللغة المكتوب بها الملف

قمت بعملية القراءة من الملف وتحديد اذا كان باللغة الانجليزية ام لا ..ولكن هل هناك اي مكتبات او كلاسات جاهزة

تساعدني في تحديد اللغة المكتوب بها الملف

العربية ,الفرنسية ...وغيرها

شكرا

#2
http://tika.apache.org/1.0/detection.html
1

http://informatic-ar.com منصة تعليمية عربية في علوم الحاسب والبرمجة

https://moalfat.com  للكتب الالكترونية والكورسات التعليمية

Everything we see now is just an engineering solution based on old science

#3

شكرا ولكن للاسف لم افهم الكثير من الرابط

في نهايته كان موجود ..

Language Detection

Tika is able to help identify the language of a piece of text, which is useful when extracting text from document formats which do not include language information in their metadata.

The language detection is provided by org.apache.tika.language.LanguageIdentifier

وحسب ما فهمت هذا كلاس جاهز

ولكن حاولت ان استخدم الميثود الموجود فيه ...ولكن برضو يستخدم كلاسات اخرى مثل LanguageProfile

ودخلت في دوامة من الكلاسات

هل يامكانك مساعدتي بطريقة ابسط ...بكون مشكور كتير الك

#4
Wajdy Essam كتب:

فعلا مكتبة رائعة لكن هل من شرح لو بقليل عن امكانيتها وكيفية استخدامها

إذا نظــرتَ نيـوب اللـّيـثِ بـارزةً         فـلا تظــنَنَ أَنَّ اللـّيـــثَ يبْتسـِـــمُ


 


 


رسم المخططات البيانية بواسطة الجافا


 


كتاب تحليل وتصميم نظم المعلومات


#5

استخدامه بسيط، مثال:

        final String text = "this is text";
        LanguageProfile profile = new LanguageProfile(text);
        LanguageIdentifier identifier = new LanguageIdentifier(profile);
        System.out.println("Language:  " + identifier.getLanguage());

ارجوا المعذرة ولكن بعد تشغيل المثال تبين لي أنها لا تدعم العربية ، واللغات المدعومة :

be,ca,da,de,eo,et,el,en,es,fi,fr,gl,hu,is,it,lt,nl,no,pl,pt,ro,ru,sk,sl,sv,th,uk

بالتفصيل:

http://svn.apache.org/viewvc/tika/trunk/tika-core/src/main/resources/org/apache/tika/language/tika.language.properties?view=markup

وهذه خطوات بناء language profile لأي لغه لمن يريد اضافة الدعم:

http://stackoverflow.com/questions/9044916/how-can-i-detect-farsi-web-pages-by-tika

المثال أعلاه كان يتعرف على النص، ومن الممكن ارسال اي stream ،،

لكن يمكنك بناء معرف للغه التي تريد،، سوف أحاول بناء معرف على العربي ان شاء الله في هاليومين لنرى النتيجة,,

بالنسبة للمكتبة فهي تقوم بعمليات parsing و metadata extraction لكثير من أنواع الملفات،، وايضاً تم اضافه هذه الميزة -تعرف على اللغة- مؤخراً..

وهي في الحقيقة تغليف لمجموعه من المكتبات Facade pattern (أي أنها تستخدم third party parser) ولكن تقدم لك API سهله وميسرة ،، لأن لكل parser دوال خاصه فيه، لكن مع Tika فقط تستخدم دوالها وهي داخلياً تقوم بما يلزم ,, ميزتها أن كل شيء تقوم بها لا يتجاوز 10 اسطر تقريباً,,

بالتوفيق،

تم تعديل هذه المشاركة بواسطة Wajdy Essam في 31 مارس 2012 في 15:56

1

http://informatic-ar.com منصة تعليمية عربية في علوم الحاسب والبرمجة

https://moalfat.com  للكتب الالكترونية والكورسات التعليمية

Everything we see now is just an engineering solution based on old science

#6
Wajdy Essam كتب:

استخدامه بسيط، مثال:

        final String text = "this is text";
        LanguageProfile profile = new LanguageProfile(text);
        LanguageIdentifier identifier = new LanguageIdentifier(profile);
        System.out.println("Language:  " + identifier.getLanguage());

ارجوا المعذرة ولكن بعد تشغيل المثال تبين لي أنها لا تدعم العربية ، واللغات المدعومة :

be,ca,da,de,eo,et,el,en,es,fi,fr,gl,hu,is,it,lt,nl,no,pl,pt,ro,ru,sk,sl,sv,th,uk

بالتفصيل:

http://svn.apache.org/viewvc/tika/trunk/tika-core/src/main/resources/org/apache/tika/language/tika.language.properties?view=markup

وهذه خطوات بناء language profile لأي لغه لمن يريد اضافة الدعم:

http://stackoverflow.com/questions/9044916/how-can-i-detect-farsi-web-pages-by-tika

المثال أعلاه كان يتعرف على النص، ومن الممكن ارسال اي stream ،،

لكن يمكنك بناء معرف للغه التي تريد،، سوف أحاول بناء معرف على العربي ان شاء الله في هاليومين لنرى النتيجة,,

بالنسبة للمكتبة فهي تقوم بعمليات parsing و metadata extraction لكثير من أنواع الملفات،، وايضاً تم اضافه هذه الميزة -تعرف على اللغة- مؤخراً..

وهي في الحقيقة تغليف لمجموعه من المكتبات Facade pattern (أي أنها تستخدم third party parser) ولكن تقدم لك API سهله وميسرة ،، لأن لكل parser دوال خاصه فيه، لكن مع Tika فقط تستخدم دوالها وهي داخلياً تقوم بما يلزم ,, ميزتها أن كل شيء تقوم بها لا يتجاوز 10 اسطر تقريباً,,

بالتوفيق،

ال المكتبة

Package org.apache.tika.detect

ليست ضمن المكتبات المتعارف عليها ضمن الجافا صحيح؟؟؟

ويجب تحميلها مع الIDM لكي يتم التعرف عليها ؟؟

من اين احملها بالزبط ؟؟

هل هذه هي ؟؟

http://www.apache.org/dyn/closer.cgi/tika/apache-tika-1.1-src.zip

كيف ارفقها مع البرنامج ليتعرف على الكلاسات الموجود فيها ؟؟

شكرا جزيلا على المجهود

تم تعديل هذه المشاركة بواسطة محمد1991 في 31 مارس 2012 في 19:21

مواضيع مشابهة