آکادمی علوم شقایق رحمانی
Open in Telegram
آموزش علوم شیمی، فیزیک و کامپیوتر Admin: @melanee_teacher Mentor Bot: @MelaneeMentorbot
Show more800
Subscribers
-424 hours
-67 days
-4630 days
Posts Archive
الان میتونید عکس عکتیبه هایی که جمع آوری کردم رو ببینید، به مرور زمان دارم بیشترشون میکنم🤗:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset/tree/main/ImageDataset
ریپازیتوری دیتاست پروژه EPOL آپدیت شد✅:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset/tree/main
+7
سلام دوستان عزیزم🥰
من دارم یک دیتاست کامل از کتیبه های باستانی به زبان فارسی باستان (Persian Old) جمع آوری میکنم، هم دیتای Image و هم دیتای Text.
خیلی خوشحال میشم همکاری کنید اگه جایی تصاویر و یا متون کتیبه های فارسی باستان رو دیدید برام ایمیل شون کنید با ذکر مشخصات و جزییات؛ یا مستقیما در ریپازیتوری Dataset پروژه در گیت هاب بزاریدشون.
خیلی ممنونم🙏🌸
لینک گیت هاب پروژه مربوط به دیتاست:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset
آدرس ایمیلم:
melaneepython@gmail.com
#EPOL
#Datagathing
+2
یه کتیبه ی جدید دیگه پیدا کردم؛ ازین کتاب
میخوام کل دنیارو زیرو رو کنم واسه دیتاستم😅.
برای این پروژه جدیدم (فارسی باستان) میخوام بزرگترین و کاملترین دیتاست دنیارو درست کنم؛ این مرحله هست که خیلی زمان بره.
یکی از دوستان بهم گفت کارتون خیلی ارزشمنده، مثل شاهنامه فردوسی!
منم احتمالا بعد سی سال این شعر رو با خودم زمزمه میکنم:
بسی رنج بردم در این سالِ سی
عجم زنده کردم بدین باستان پارسی😄
پروژه ی Electronic Persian Old Libeary
آپدیت شد✅.
https://github.com/Electronic-Persian-Old-Library
چون حجم پروژه زبان فارسی باستان زیاده و در آینده قراره وسیع تر بشه و خب مسلما در یک ریپازیتوری گیت هاب جا نمیشه؛ به همین علت براش یک organisation ساختم.
اگه کسی علاقه داشته باشه روی این پروژه کار کنه؛ میتونه بهم ایمیل بزنه تا من عضو لیست People کنم ایشون رو، خیلی هم خوشحال میشم🥰.
هر کاری خواستید روی پروژه انجام بدید میتونید یک ریپازیتوری جدید بسازید و اونجا سورس کدها و یا منابعتون رو بزارید.
کارهای غیر فنی و غیر کدی هم زیاد دارم؛ مثلا پیدا کردن کتاب های خوب، مقاله، ساختن world list برای این زبان، جمع آوری دیتای عکس از کتیبه ها یا دیتای متنی از زبان فارسی باستان و ....
فکر کنم این اورگانیزیشن قراره با ارزش ترین دستاورد زندگیم باشه.
الهی به امید تو
آدرس ایمیلم:
melaneepython@gmail.com
لینک گیت هاب این اورگانیزیشن:
https://github.com/Electronic-Persian-Old-Library
بچه ها من به پروفسور انریکه جیمنز هنوز نگفتم که خودم یه پروژه ی جدید واسه زبان فارسی باستان شروع کردم؛ (خودشون رو زبان بابِلی کار میکنند). به نظرتون بهش بگم؟ میگم یوقت ناراحت نشه.
این پروژه ای که جدیدا شروع کردم قطعا مدت زمان خیلی زیادی طول میکشه تا بتونم به یه جای خوبی برسونمش. علتش هم اینکه که دیتای کافی برای زبان فارسی باستان وجود نداره و من خودم باید از صفر همه چیشو شروع کنم به جمع آوری، کار بشدت سختیه ولی برام شیرینه🥺.
اگه بخوام با مدل های NLP مثل BiLSTM یا HEMM برنامه ترجمه زبان فارسی باستان رو بنویسم مسلما دیتای زیادی نیاز دارم، در غیر این صورت مدل هام Accuracy خوبی نخواهند داشت؛ ولی عیبی نداره بالخره همه ی زبان های دنیا از یه جایی شروع شدند به توسعه داده شدن، منم زبان فارسی باستان رو توسعه میدم.
یه مدلی بسازم که گوگل ترنسلیت بیاد بهم بگه مدلهاتو بده من استفاده کنم😅.
ادامه:
راجب کتیبه های خورد شده گیلگمش که پرفسور انریکه جیمنز روشون کار کردند، قضیه ساده تر بود چون از همون زمان های قدیم، از برخی کتیبه ها دو نسخه کپی وجود داشته و بدین ترتیب لبه ی خارجی بعضی کتیبه ها با هم overlap داشتند و راحت تر شناسایی میشدند.
وقتی تعداد کتیبه ها زیاد باشه این الگوریتم های هوش مصنوعی خیلی راحت میتونند بهمون کمک کنند.
توضیحات بیشتر رو در مقاله ام در Medium گفتم.
لینک گیت هاب پروژه matcher
کتاب فارسی باستان
دستور، گزیده ای از کتیبه ها، واژه نامه
نویسنده: هاشم رضی
تعداد صفحات: ۲۹۲
+1
یک کتاب خیلی جالب و با ارزش پیدا کردم، یعنی عاشق تک تک صفحاتش شدم🥰.
پی دی افش رو میزارم براتون.
در زبان فارسی باستان هر کلمه با یک میخ کج از کلمه ی بعدی جدا میشه.
اگه جایی کتیبه میخی فارسی باستان دیدید، به این نکته توجه کنید.
در فاز بعدی پروژه ام (بعد از OCR) برای ترجمه زبان فارسی باستان، باید یه world list درست کنم، یه جورهایی مثل یه فرهنگ لغت که معنی هر کلمه رو نوشته باشه. احتمالا یه چند سالی از عمرم میره تا من این لیست رو بتونم جمع آوری و تدوین کنم🤭.
سپس در فاز بعدی پروژه وارد مرحله NLP میشم.
+2
ساعت ۵ صبح بوقت ۳۰ خرداد ۱۴۰۳ هجری خورشیدی، من همچنان در حال تلاش برای ساختن مدل OCR برای زبان خط میخی فارسی باستان هستم🥰.
لحظه های قشنگیه...
من دارم این مدل رو مینویسم برای روزگاری که ممکنه در آینده شخصیت های بزرگ و باسوادی مثل پروفسور مجید ارفعی دیگه تو این دنیا نباشند که بتونند خط میخی رو ترجمه کنند.
لااقل مدل من تو این دنیا میمونه و آدم ها به کمک هوش مصنوعی میتونند همچنان خط میخی رو ترجمه کنند و پرده از اسرار تاریخ بردارند.
پ.ن: تصویر۲: منشور حقوق ملل کوروش که اولین بار توسط پوفسور محید ارفعی به زبان فارسی مدرن ترجمه شد
تصویر۳: دارم مراحل پیش پردازش داده رو انجام میدم، باید تصویر اصلی رو تبدیل کنم به یه تصویر سیاه و سفید خام با کیفیت که مدلم بتونه بخونش.
فکر کنم من اولین ایرانی هستم که دارم روی زبان میخی فارسی باستان به کمک الگوریتم های AI کار میکنم❤🕊.
+1
به نام وطن❤🕊
تو تخیلاتم آرزو میکنم از خودم هزارتا تکثیر کنم بعد هرکدوم خودمو بزارم تو یه لوکیشن تاریخی و باستانی ایران و از اونجا محافظت کنم!🥺
کاش خونمون تو تخت جمشید بود، هر روز می اومدم سنگ هاشو بوس میکردم، زمینشو آب و جارو میکردم!🥺
لوکیشن: موزه ملی ایران
الواح زرین و سیمین داریوش بزرگ که به سه زبان میخی فارسی باستان، بابِلی و ایلامی نوشتنش.
بحمد خدا مدل OCR زبان میخی فارسی باستان رو مینویسم یه روز.
این مدت واسه پروژه ی رمزگشایی کتییه های باستانی به چند تا متخصص تو کل دنیا ایمیل زدم، همه جواب دادن به جز ایرانی ها! حتی یکی وسط جنگ هم جواب ایمیلمو داد ولی هم وطن های خودم جواب ندادند.
واقعا چرا ایمیل هارو جدی نمیگیرید؟! رسمی ترین راه ارتباطی آدم ها همین ایمیله به نظرم، جواب بدید.
دوستان این پروژه AI من واسه رمزگشایی خط میخی زبان فارسی باستان به نظرم یه پروژه ی ملی هست چون اثر مثبتش رو کل مردم کشور عزیزمون ایران میبینند و از لحاظ فرهنگی تاثیر زیادی رو آدم ها داره، نه تنها ایرانی ها بلکه مردم کل دنیا.
به نظرم احتمال داره در آینده دیگه کسی (مغز انسانی) وجود نداشته باشه که بتونه این خط های میخی رو ترجمه کنه ولی این پروژه های AI ما تو دنیا میمونه و میتونه متن کتیبه های باستانی رو به راحتی ترجمه کنه، این خیلی اتفاق بزرگیه.
خلاصه خواستم اهمیت کار رو متوجه بشید و همکاری کنید من یه متخصص OCR پیدا کنم🥰🙏💖🌸🕊❤.
تو روزهای سخت زندگیم به سر میبرم، ساختن یه الگوریتم ocr واسه زبان میخی فارسی باستان شده آرزوم ولی خب با همه سختی هاش خیلی شیرینه برام🥺❤.
بلخره روزی میرسه به خودم میگم ارزششو داشت!
کار کردن روی این پروژه ها خیلی سخته چون برای این زبان (Persian old cuneifoem) منابع کافی وجود نداره و من محبورم تمام الگوریتم هارو خودم از اول بنویسم، مدل جدید بسازم، دیتاست جدید درست کنم و ....
اون مدل YOLOv8 هم خوب جواب نداد بهم.
دوستان من به یک متخصص OCR یا پردازش تصویر حرفه ای نیاز دارم، اگر کسی رو میشناسید ممنون میشم بهم معرفی کنید🙏❤🕊.
آیدی من :
@melanee2023
