آکادمی علوم شقایق رحمانی
Open in Telegram
آموزش علوم شیمی، فیزیک و کامپیوتر Admin: @melanee_teacher Mentor Bot: @MelaneeMentorbot
Show more800
Subscribers
-424 hours
-67 days
-4630 days
Posts Archive
دوستان بالخره مدل OCR خط فارسی باستان رو نوشتم😍🥰🥳.
یک ماه و نیم درگیر نوشتن مدلش بودم که بلخره خداروشکر دیروز موفق شدم خروجی مدلم رو بگیرم. البته الان هنوز دقت خوبی نداره و
Confidence score= 0.5
هست؛ چون اول کار بودم دیتای کمی بهش دادم. شبکه های عصبیش با Torch نوشته شده.
حالا ازین به بعد دیتای بیشتر و با کیفیت تری میخوام بهش بدم که به دقت خوبی برسم.
خیلی خوشحالم ولی train کردنش خیلی طول کشید، حدود ۳ ساعت! کاش یه سیستم قوی داشتم بهتر میتونستم مدلم رو optimize کنم🥺.
خطای نصب پکیج های pip رو شاید این روزها زیاد ببینیم که میگه Timeout شدید؛ این خطا به علت مشکلات connection شما و احتمالا تحریم ها ایجاد میشه.
اگر میخواید بدون استفاده از VPN و تغییر DNS بتونید این پکیج هارو نصب کنید چند تا نکته بهتون میگم. توجه کنید نکته ها رو برای سیستم عامل GNU/Linux و توزیع Ubuntu دارم میگم:
۱. پکیج منیجر apt رو همیشه آپدیت نگه دارید و mirror هاشو جایی تنظیم کنید که بتونه آپدیت هارو بگیره چون پکیج منیجر pip خودش توسط پکیج منیجر apt مدیریت میشه!
تنظیم میرورهای apt واسه توزیع ابونتو در این مسیره:
etc/apt/sources.list
۲. خود pip رو ورژنش رو کنترل کنید که آخرین ورژن باشه، یعنی آپدیت باشه.
۳. تمام آپدیت های روزانه سیستم عامل لینوکس که مربوط به security update میشن رو انجام بدید، به خصوص آپدیت های مربوط به system components
۴. از میرور های ایرانی pip، مستقیم در کامندش استفاده کنید، ساختار کامندش اینطوری میشه:
pip install اسم پکیج --index-url آدرس میرور
برای مثال میتونید از کامند زیر که حاوی آدرس میرور aliyun هست برای نصب پکیج pandas استفاده کنید:
pip install pandas --index-url https://mirrors.aliyun.com/pypi/simple/
آدرس میرورهای دیگه ای که میتونید استفاده کنید:
https://pypi.mirrors.ustc.edu.cn/simple/
https://repo.huaweicloud.com/repository/pypi/simple/
توجه: موقع کامند زدن دقت کنید پکیج منیجر شما با دستور pip کار میکنه یا pip3.
کلا لینوکس یه سیستم عاملی هست که باید با آپدیت ها زنده نگهش داریم و نرم افزارهاش همه به صورت تو در تو به هم پیوسته هستند. اگر معماری لینوکس رو ندونیم، علت خطاهاشو متوجه نمیشیم و نمیتونیم برطرفشون کنیم. ولی وقتی بلدش باشیم دیگه معما چو حل گشت آسان شود... 🥰.
موفق باشید
مِلانیعاشورای حسینی تسلیت باید🖤.
دیروز داشتم فکر میکردم چقدر این محرم و عاشورا در ادبیات و فرهنگ کشور ما تاثیرگزار بوده، طی قرن ها چقدر شعر و موسیقی و نمایشنامه و آثار هنری و ادبی ازش ساختند.
خیلی قشنگه، خیلی...
+3
𐎠𐎢𐎼𐎶𐏀𐎡𐎠 (اهورامزدا) (Ahuramazda)
اولین کلمه ای که از زبان فارسی باستان یاد گرفتم، کلمه ی "اهورامزدا" بود🥰.
اگر داریوش بزرگ میدونست قراره زبانی که که اختراع کرده، ۲۵۰۰ سال بعد توسط یه دخترخانمی به اسم مِلانی و توسط یه وسیله ای به اسم کامپیوتر ترجمه و رمزگشایی بشه قطعا از تعجب شاخ درمی آورد🤭.
این عکس ها هم خواستگاه اولین جایی هست که در جهان مدل های AI روی خط میخی فارسی باستان اجرا شد (اینجا میز کارمه)😅.
گیت هاب OCR پروژه:
https://lnkd.in/dhbnpxDh
بماند به یادگار
#اهورامزدا
#زبان_فارسی_باستان
تا حالا دو تا درس مهم ازین پروژه جدیدم (EOPL) گرفتم:
اولیش اینکه وقتی برنامه ای مینویسم حتما شماره ورژن کتابخونه ها و ابزارهایی که استفاده میکنم رو مکتوب کنم به طوری که افراد دیگه چند سال بعد از من بتونند برنامه ی من رو اجرا کنند.
دوم اینکه دیتاهایی که با ارزش هستند رو حتما براشون یه فایل metadata تهیه کنم. مثلا تصویر کتیبه های زبان فارسی باستان رو که من دارم از کل دنیا جمع آوری میکنم برای هر دایرکتوریش یه فایل metadata درست کردم و اطلاعات اون عکس هارو داخل یه فایل متادیتا با فرمت CSV ذخیره کردم. برای دیتای text هم همین کارو کردم که مثلا ترجمه این کتیبه رو از کجا آوردم و کی ترجمه اش کرده و کلی مشخصات دیگه.
این دیتاها چون با ارزش هستند و هر کدومشون جزو اسناد هویتی کشورمون محسوب میشن من مجبور بودم فایل های متادیتا هم براشون درست کنم که البته کار بسیار سخت و وقت گیری هست چون باید دیتارو با دقت زیاد، ویرگول به ویرگول، سل به سل وارد این فایل متادیتا کنم! و اینکه وقتی دیتاست من به مرور زمان بزرگ میشه؛ کار پردازش دیتای من راحت تر میشه.
برای مثال متادیتای دیتاهایی که از موزه بریتانیا جمع آوری کردم رو ببینید:
https://github.com/Electronic-Old-Persian-Library/Old-Persian-Dataset/tree/main/imagedata/british_museum/metadata
پروژه ی OCR آپدیت شد✅:
https://github.com/Melanee-Melanee/Old-Persian-Cuneiform-OCR?tab=readme-ov-file
آقای Roman Heut یکی از دولوپرهای openai قدرت ChatGPT رو در این فیلم نشون داده؛ من فقط دلم میخواد گریه کنم الان😭🥺.
https://www.linkedin.com/posts/genai-works_ai-generativeai-innovation-activity-7216439181898616832-dFPA?utm_source=share&utm_medium=member_android
معرفی زنده یاد خانم دکتر بدرالزمان قریب، از اساطیر زبان شناسی ایران و استاد زبان های باستانی دانشگاه تهران از زبانِ دکتر مجتبایی استاد دانشگاه تهران:
آشنایی من با بدرالزمان قریب به پیش از فرهنگستان زبان و ادب فارسی و به سال ۱۳۲۹ برمیگردد، زمانی که با هم در دانشکده ادبیات هم دوره بودیم. خاطرم هست زمانی هم که در دانشگاه هاروارد مشغول تحصیل بودم، وی که در دانشگاه پنسیلوانیا تحصیل میکرد به شهر کمبریج آمد تا با دکتر ریچارد فرای زبان خوارزمی کار کند. وی تخصصاش زبان سُغدی بود که در این حوزه فرهنگنامه ارزشمندی هم منتشر کرده است.
دکتر مجتبایی در توضیح دلایل پرداختن بدرالزمان قریب به زبان سُغدی اظهار کرد: پیشرفت علم زمانی اتفاق میافتد که یک پژوهشگر به سمت موضوعی میرود که کسی اطلاعی از آن ندارد. محقق واقعی کسی است که به سراغ سوژههای جدید میرود؛ به نظر من رفتن به سمت موضوعی که همه میدانند و صحبت کردن درباره آن که دیگر هنر نیست.
مجتبایی در پایان گفت: محقق واقعی به دنبال مجهولات فرهنگ و تاریخ میرود و به علت این که آن موضوع طرفدار ندارد و کسی به سمت او نرفته به سمت آن میرود و درباره آن مینویسد و عمرش را سر آن میگذارد تا نقطه تاریک را روشن کند. اگر کسی بخواهد برای دل جامعه کار کند به جایی نمیرسد، پس باید به روشن کردن قسمتهای تاریک تاریخ بپردازد؛ حال میخواهد مردم بفهمند یا نفهمند.
پ.ن: زبان سُغدی یکی از زبان های باستانی ایران هست که کمتر کسی در طول تاریخ بهش پرداخته.
منبع
کتاب ارزشمند "فرمانهای شاهنشاهان هخامنشی" نوشته نورمن شارپ
نورمن شارپ سالها پیش بسیاری از کتیبه های با زبان #فارسی_باستان رو در این کتاب جمع آوری کرده.
متاسفانه تا الان هنوز کسی نتونسته روی پروژه ی کتابخانه زبان فارسی باستان الکترونیک (EPOL) کار کنه، خودم احتمال میدم علتش اینه که برای کار روی این پروژه به یک سواد حداقلی از زبان فارسی باستان نیاز هست که متاسفانه کسی این زبان رو بلد نیست. یکم راجب این زبان توضیح میدم و حروف اصلی و یک منبع مهمی که خودم خوندم رو بهتون معرفی میکنم.
زبان فارسی باستان (Persian Old) یک نوع زبان خط میخی و زبان رسمی حکومت هخامنشیان در ایران بوده و دارای ۳۶ دبیره یا حرف هست. غیر از این زبان، خط های میخی دیگه ای هم از زمان های قدیم تر وجود داشتند.
قبل از حکومت هخامنشیان و زبان فارسی باستان، زبان های میخی دیگه ای در دنیا وجود داشته، برای مثال زبان میخی بابِلی (Babylonian) که نوعی زبان میخی اکدی (Akkadian) هست، زبان میخی عیلامی (Elamite) و ... . این نوع زبان های میخی بیش از ۹۰۰ حرف دارند و حروف میخیشون اشکال بسیار پیچیده تری از زبان فارسی باستان دارند. این زبان ها زبان رسمی کشور ایران نبوده اند چون اون زمان ها هنوز مرزبندی ها تعیین نشده بود و کشور ایران (Persia) هنوز بوجود نیومده بوده و زبان های میخی صرفا زبان قوم ها و تمدن های مختلف جهان بودند. به همین علت هست که در مجامع علمی و دانشگاهی سطح جهانی خیلی روی زبان های میخی اکدی، بابلی و ایلامی کار کردند چون این زبان ها اولین زبان هایی هستند که توسط بشر بوجود آمدند؛ پس به نوعی این زبان ها نشان دهنده فرهنگ و هویت کل مردم جهان هستند نه فقط یک کشور!
جالبه بدونید اولین جایی در دنیا که خط توسط بشر بوجود اومد یه جایی به اسم بین النهرین (Mesopotamia) امروزی در کشور عراق هست. در واقع اولین تمدن رسمی بشر از اینجا به وجود اومده.
اما زبان میخی فارسی باستان آخرین نسل خط میخی جهان بوده و صرفا توسط ایرانی ها اختراع شده و زبان رسمی مردم ایران باستان بوده. متاسفانه به دلیل اینکه این زبان صرفا مال ملیت ایرانی ها بوده توسط محققین کشورهای دیگه تحقیق خاص و قابل توجهی روش انجام نشده و از همه بدتر اینکه خود ایرانی ها هم تحقیق و پژوهشی روی این زبان انجام نداده اند! به خاطر همین وقتی این موضوع رو متوجه شدم تصمیم گرفتم به عنوان یک ایرانی برای اولین بار روی این زبان، تحقیقات علمی گسترده ای انجام بدم و با کمک هوشمندانه ترین تکنولوژی های دنیا یعنی الگوریتم های هوش مصنوعی (AI) روی این زبان کار کنم.
بوقت تیرماه ۱۴۰۳
شقایق رحمانی
تاریخ این پست رو ببینید! واسه پارسال بوده، ۲۶ سپتامبر ۲۰۲۳.
دارم اهدافمو یکی یکی تیک میزنم😎.
+3
اون دست نویس های ماری کوری رو یادتونه؟!
اینام دست نویس های منه واسه طراحی دیتاست پروژه زبان فارسی باستان (EPOL)!😅
الان دو هفته است درگیرمش، یه بار طراحیش کردم دوباره عوضش کردم وبا یه استراکچر جدید طراحیش کردم به طوری که قابلیت اینو داره در آینده بزرگتر و وسیع تر بشه.
خود این دیتاست میتونه یه پروژه بزرگ باشه حالا مراحل AI اش که بماند!
برای تک تک دیتاهام اطلاعاتش رو داخل یه فایل metadata با فرمت CSV ذخیره کردم. تمام اطلاعات رو دارم با دقت زیاد، خودم دستی وارد میکنم، ربات هم نمیتونه دیتای منو جمع کنه چون نمیتونه خط میخی فارسی باستان رو تشخیص بده! دقیقا همه چیو خودم باید وارد کنم، دونه به دونه، سل به سل، ویرگول به ویرگول!😓
چشمام درد گرفت دیگه.
دوستان محترم الان میتونید عکس کتیبه هایی که از زبان فارسی باستان جمع آوری کردم رو ببینید؛ به مرور زمان دارم بیشترشون میکنم🤗، ولی پوستم کنده شده خیلی کار سخت و وقتگیری هست.
متخصصین محترم AI لطف میکنید یه نگاه به ساختار کلی دیتاستم بندازید ببینید خوب طراحیش کردم؟ آیا این طراحی و فایل بندی من مناسب کار AI هست با توجه به اینکه دیتاست در آینده بزرگ تر میشه؟
(توجه کنید این دیتاست فقط دیتای خام هست بدون لیبل گزاری و ... )
لینک دیتاست در گیتهاب:
https://github.com/Electronic-Persian-Old-Library/Persian-Old-Dataset/tree/main/ImageDataset
آدرس ایمیل من:
melaneepython@gmail.com
