آکادمی علوم شقایق رحمانی
Kanalga Telegram’da o‘tish
آموزش علوم شیمی، فیزیک و کامپیوتر Admin: @melanee_teacher Mentor Bot: @MelaneeMentorbot
Ko'proq ko'rsatish791
Obunachilar
Ma'lumot yo'q24 soatlar
-67 kun
-2130 kun
Postlar arxiv
متاسفانه تا الان هنوز کسی نتونسته روی پروژه ی کتابخانه زبان فارسی باستان الکترونیک (EPOL) کار کنه، خودم احتمال میدم علتش اینه که برای کار روی این پروژه به یک سواد حداقلی از زبان فارسی باستان نیاز هست که متاسفانه کسی این زبان رو بلد نیست. یکم راجب این زبان توضیح میدم و حروف اصلی و یک منبع مهمی که خودم خوندم رو بهتون معرفی میکنم.
زبان فارسی باستان (Persian Old) یک نوع زبان خط میخی و زبان رسمی حکومت هخامنشیان در ایران بوده و دارای ۳۶ دبیره یا حرف هست. غیر از این زبان، خط های میخی دیگه ای هم از زمان های قدیم تر وجود داشتند.
قبل از حکومت هخامنشیان و زبان فارسی باستان، زبان های میخی دیگه ای در دنیا وجود داشته، برای مثال زبان میخی بابِلی (Babylonian) که نوعی زبان میخی اکدی (Akkadian) هست، زبان میخی عیلامی (Elamite) و ... . این نوع زبان های میخی بیش از ۹۰۰ حرف دارند و حروف میخیشون اشکال بسیار پیچیده تری از زبان فارسی باستان دارند. این زبان ها زبان رسمی کشور ایران نبوده اند چون اون زمان ها هنوز مرزبندی ها تعیین نشده بود و کشور ایران (Persia) هنوز بوجود نیومده بوده و زبان های میخی صرفا زبان قوم ها و تمدن های مختلف جهان بودند. به همین علت هست که در مجامع علمی و دانشگاهی سطح جهانی خیلی روی زبان های میخی اکدی، بابلی و ایلامی کار کردند چون این زبان ها اولین زبان هایی هستند که توسط بشر بوجود آمدند؛ پس به نوعی این زبان ها نشان دهنده فرهنگ و هویت کل مردم جهان هستند نه فقط یک کشور!
جالبه بدونید اولین جایی در دنیا که خط توسط بشر بوجود اومد یه جایی به اسم بین النهرین (Mesopotamia) امروزی در کشور عراق هست. در واقع اولین تمدن رسمی بشر از اینجا به وجود اومده.
اما زبان میخی فارسی باستان آخرین نسل خط میخی جهان بوده و صرفا توسط ایرانی ها اختراع شده و زبان رسمی مردم ایران باستان بوده. متاسفانه به دلیل اینکه این زبان صرفا مال ملیت ایرانی ها بوده توسط محققین کشورهای دیگه تحقیق خاص و قابل توجهی روش انجام نشده و از همه بدتر اینکه خود ایرانی ها هم تحقیق و پژوهشی روی این زبان انجام نداده اند! به خاطر همین وقتی این موضوع رو متوجه شدم تصمیم گرفتم به عنوان یک ایرانی برای اولین بار روی این زبان، تحقیقات علمی گسترده ای انجام بدم و با کمک هوشمندانه ترین تکنولوژی های دنیا یعنی الگوریتم های هوش مصنوعی (AI) روی این زبان کار کنم.
بوقت تیرماه ۱۴۰۳
شقایق رحمانی
تاریخ این پست رو ببینید! واسه پارسال بوده، ۲۶ سپتامبر ۲۰۲۳.
دارم اهدافمو یکی یکی تیک میزنم😎.
+3
اون دست نویس های ماری کوری رو یادتونه؟!
اینام دست نویس های منه واسه طراحی دیتاست پروژه زبان فارسی باستان (EPOL)!😅
الان دو هفته است درگیرمش، یه بار طراحیش کردم دوباره عوضش کردم وبا یه استراکچر جدید طراحیش کردم به طوری که قابلیت اینو داره در آینده بزرگتر و وسیع تر بشه.
خود این دیتاست میتونه یه پروژه بزرگ باشه حالا مراحل AI اش که بماند!
برای تک تک دیتاهام اطلاعاتش رو داخل یه فایل metadata با فرمت CSV ذخیره کردم. تمام اطلاعات رو دارم با دقت زیاد، خودم دستی وارد میکنم، ربات هم نمیتونه دیتای منو جمع کنه چون نمیتونه خط میخی فارسی باستان رو تشخیص بده! دقیقا همه چیو خودم باید وارد کنم، دونه به دونه، سل به سل، ویرگول به ویرگول!😓
چشمام درد گرفت دیگه.
دوستان محترم الان میتونید عکس کتیبه هایی که از زبان فارسی باستان جمع آوری کردم رو ببینید؛ به مرور زمان دارم بیشترشون میکنم🤗، ولی پوستم کنده شده خیلی کار سخت و وقتگیری هست.
متخصصین محترم AI لطف میکنید یه نگاه به ساختار کلی دیتاستم بندازید ببینید خوب طراحیش کردم؟ آیا این طراحی و فایل بندی من مناسب کار AI هست با توجه به اینکه دیتاست در آینده بزرگ تر میشه؟
(توجه کنید این دیتاست فقط دیتای خام هست بدون لیبل گزاری و ... )
لینک دیتاست در گیتهاب:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset/tree/main/ImageDataset
آدرس ایمیل من:
melaneepython@gmail.com
الان میتونید عکس عکتیبه هایی که جمع آوری کردم رو ببینید، به مرور زمان دارم بیشترشون میکنم🤗:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset/tree/main/ImageDataset
ریپازیتوری دیتاست پروژه EPOL آپدیت شد✅:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset/tree/main
+7
سلام دوستان عزیزم🥰
من دارم یک دیتاست کامل از کتیبه های باستانی به زبان فارسی باستان (Persian Old) جمع آوری میکنم، هم دیتای Image و هم دیتای Text.
خیلی خوشحال میشم همکاری کنید اگه جایی تصاویر و یا متون کتیبه های فارسی باستان رو دیدید برام ایمیل شون کنید با ذکر مشخصات و جزییات؛ یا مستقیما در ریپازیتوری Dataset پروژه در گیت هاب بزاریدشون.
خیلی ممنونم🙏🌸
لینک گیت هاب پروژه مربوط به دیتاست:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset
آدرس ایمیلم:
melaneepython@gmail.com
#EPOL
#Datagathing
+2
یه کتیبه ی جدید دیگه پیدا کردم؛ ازین کتاب
میخوام کل دنیارو زیرو رو کنم واسه دیتاستم😅.
برای این پروژه جدیدم (فارسی باستان) میخوام بزرگترین و کاملترین دیتاست دنیارو درست کنم؛ این مرحله هست که خیلی زمان بره.
یکی از دوستان بهم گفت کارتون خیلی ارزشمنده، مثل شاهنامه فردوسی!
منم احتمالا بعد سی سال این شعر رو با خودم زمزمه میکنم:
بسی رنج بردم در این سالِ سی
عجم زنده کردم بدین باستان پارسی😄
پروژه ی Electronic Persian Old Libeary
آپدیت شد✅.
https://github.com/Electronic-Persian-Old-Library
چون حجم پروژه زبان فارسی باستان زیاده و در آینده قراره وسیع تر بشه و خب مسلما در یک ریپازیتوری گیت هاب جا نمیشه؛ به همین علت براش یک organisation ساختم.
اگه کسی علاقه داشته باشه روی این پروژه کار کنه؛ میتونه بهم ایمیل بزنه تا من عضو لیست People کنم ایشون رو، خیلی هم خوشحال میشم🥰.
هر کاری خواستید روی پروژه انجام بدید میتونید یک ریپازیتوری جدید بسازید و اونجا سورس کدها و یا منابعتون رو بزارید.
کارهای غیر فنی و غیر کدی هم زیاد دارم؛ مثلا پیدا کردن کتاب های خوب، مقاله، ساختن world list برای این زبان، جمع آوری دیتای عکس از کتیبه ها یا دیتای متنی از زبان فارسی باستان و ....
فکر کنم این اورگانیزیشن قراره با ارزش ترین دستاورد زندگیم باشه.
الهی به امید تو
آدرس ایمیلم:
melaneepython@gmail.com
لینک گیت هاب این اورگانیزیشن:
https://github.com/Electronic-Persian-Old-Library
بچه ها من به پروفسور انریکه جیمنز هنوز نگفتم که خودم یه پروژه ی جدید واسه زبان فارسی باستان شروع کردم؛ (خودشون رو زبان بابِلی کار میکنند). به نظرتون بهش بگم؟ میگم یوقت ناراحت نشه.
این پروژه ای که جدیدا شروع کردم قطعا مدت زمان خیلی زیادی طول میکشه تا بتونم به یه جای خوبی برسونمش. علتش هم اینکه که دیتای کافی برای زبان فارسی باستان وجود نداره و من خودم باید از صفر همه چیشو شروع کنم به جمع آوری، کار بشدت سختیه ولی برام شیرینه🥺.
اگه بخوام با مدل های NLP مثل BiLSTM یا HEMM برنامه ترجمه زبان فارسی باستان رو بنویسم مسلما دیتای زیادی نیاز دارم، در غیر این صورت مدل هام Accuracy خوبی نخواهند داشت؛ ولی عیبی نداره بالخره همه ی زبان های دنیا از یه جایی شروع شدند به توسعه داده شدن، منم زبان فارسی باستان رو توسعه میدم.
یه مدلی بسازم که گوگل ترنسلیت بیاد بهم بگه مدلهاتو بده من استفاده کنم😅.
ادامه:
راجب کتیبه های خورد شده گیلگمش که پرفسور انریکه جیمنز روشون کار کردند، قضیه ساده تر بود چون از همون زمان های قدیم، از برخی کتیبه ها دو نسخه کپی وجود داشته و بدین ترتیب لبه ی خارجی بعضی کتیبه ها با هم overlap داشتند و راحت تر شناسایی میشدند.
وقتی تعداد کتیبه ها زیاد باشه این الگوریتم های هوش مصنوعی خیلی راحت میتونند بهمون کمک کنند.
توضیحات بیشتر رو در مقاله ام در Medium گفتم.
لینک گیت هاب پروژه matcher
کتاب فارسی باستان
دستور، گزیده ای از کتیبه ها، واژه نامه
نویسنده: هاشم رضی
تعداد صفحات: ۲۹۲
+1
یک کتاب خیلی جالب و با ارزش پیدا کردم، یعنی عاشق تک تک صفحاتش شدم🥰.
پی دی افش رو میزارم براتون.
در زبان فارسی باستان هر کلمه با یک میخ کج از کلمه ی بعدی جدا میشه.
اگه جایی کتیبه میخی فارسی باستان دیدید، به این نکته توجه کنید.
در فاز بعدی پروژه ام (بعد از OCR) برای ترجمه زبان فارسی باستان، باید یه world list درست کنم، یه جورهایی مثل یه فرهنگ لغت که معنی هر کلمه رو نوشته باشه. احتمالا یه چند سالی از عمرم میره تا من این لیست رو بتونم جمع آوری و تدوین کنم🤭.
سپس در فاز بعدی پروژه وارد مرحله NLP میشم.
