en
Feedback
مرجع دیتاست فارسی

مرجع دیتاست فارسی

Open in Telegram

لطفا برای معرفی و درج دیتاست خود داخل کانال به @data_hub پیام دهید.

Show more
3 085
Subscribers
No data24 hours
+127 days
+4030 days
Posts Archive
این مخزن با ایده تسهیل دسترسی و آشنایی پژوهشگران و روزنامه‌نگاران به داده‌های باز با محوریت اختصاصی ایران ساخته شده‌است که شامل منابع دولتی، مراکز پژوهشی دولتی، مراکز بین‌المللی و موسسات مستقل اشتراک‌گذاری داده می‌باشد. (با ستاره دادن به من و با انتشارش به کسانی که پژوهشگر یا روزنامه‌نگار هستند انرژی بدید.) دسترسی سریع به منابع داده‌های رسمی و دولتی مراکز پژوهشی رسمی منابع رسمی بین‌المللی موسسات مستقل اشتراک‌گذاری داده پلتفرم‌های اشتراک داده https://github.com/alirezach/awesome-iran-opendata

دیتاست پرسش و پاسخ فارسی (تر و تازه) 📱 GitHub Repo

we present a new, diverse, and publicly-available dataset of machine-generated text in Persian. By utilizing the OpenAI’s GPT-3.5 Turbo model, we’ve created a comprehensive collection of machine-generated content spanning various themes and levels of formality. We used all Digikala comments, COPER articles, and a subset of pn_summary as human-written text and generated their paraphrases using ChatGPT. 📱 GitHub Repo

اگر شما هم مثل من مشکل دارید که وقتی میرید توی سایت medium.com و مقالات اکثرا پریمیوم هست و نمیتونید بخونید، باید بگم که خدا شما رو دوست داشته که این پست رو دیدید.😁 خب حالا راه حل چیه؟🤔 فقط کافیه لینک مقاله رو توی این سایت بزارید | readmedium.com | و تمام🪄. Amirreza Heydari

این دیتاست پزشکی مناسب برای پروژه‌های پرسش و پاسخ (QA) با هدف بهبود سیستم‌های هوش مصنوعی در زمینه تشخیص و پاسخ به سوالات پزشکی تهیه شده است. این مجموعه شامل نمونه‌های سوال و جواب مرتبط با موضوعات پزشکی است که از منابع معتبر جمع‌آوری شده‌اند. از این دیتاست می‌توان در پروژه‌های پردازش زبان طبیعی (NLP) و سیستم‌های هوشمند پزشکی استفاده کرد. 📱 GitHub Repo

این پروژه به خلاصه‌سازی خودکار گفتار پرداخته است. با استفاده از الگوریتم‌های پردازش زبان طبیعی و تکنیک‌های یادگیری ماشین، این سیستم قادر است گفتار را به متن تبدیل کرده و خلاصه‌ای از آن را ارائه دهد. این پروژه می‌تواند در برنامه‌های متنوعی مانند تولید محتوا، استنطاق خودکار جلسات و استخراج اطلاعات کلیدی از فایل‌های صوتی مفید باشد. 📱 GitHub Repo

تازگی این مدل بحث ها مد شده و راحت میشه مقاله داد، خیلی مورد پسند دوستان چپ و دموکرات هستش... این مخزن گیت‌هاب حاوی مجموعه‌ای از ابزارها و منابع برای مطالعه و شناسایی سوگیری‌ها در پردازش زبان طبیعی (NLP) است. این ابزارها به شما کمک می‌کنند تا مدل‌های یادگیری ماشین خود را از لحاظ وجود سوگیری‌های مختلف بررسی کرده و آن‌ها را بهبود بخشید. از این منابع می‌توانید در پروژه‌های تحقیقاتی، توسعه مدل‌های NLP و همچنین در جلوگیری از تبعیض و بی‌عدالتی در کاربردهای مختلف زبان‌شناسی رایانشی بهره ببرید. برای اطلاعات بیشتر و دسترسی به کدها، به لینک زیر مراجعه کنید: 📱 GitHub Repo

Repost from دیتاهاب
🍻 اولین دورهمی هوش مصنوعی دیتاهاب (اصفهان) 📗موضوع: درآمد دلاری از طریق هوش مصنوعی دورهمی هوش مصنوعی چی هستش؟ قراره ماهی یک
🍻 اولین دورهمی هوش مصنوعی دیتاهاب (اصفهان) 📗موضوع: درآمد دلاری از طریق هوش مصنوعی دورهمی هوش مصنوعی چی هستش؟ قراره ماهی یک بار دور هم جمع بشیم، منظور فعالین و علاقمندای هوش مصنوعی هستش هدفمون چیه؟ انتقال تجربه به همدیگه و البته قراره کلی دوست و همکار جدید پیدا کنیم. 🗓 تاریخ برگزاری: پنج شنبه، 8 شهریور، ساعت 18 ✅ لینک ثبت نام 📛 توجه: برای شرکت در رویداد، ثبت نام ضروری هست. ❇️@data_hub_ir ❇️data-hub.ir ❇️Linkedin ❇️09938013176

سلام دوستان من یه پکیج پایتون نوشتم برای تبدیل pdf به word فارسی این پکیج کاملا از زبان فارسی پشتیبانی میکنه. این پکیح رو تویpypi منتشر کردم https://pypi.org/project/persian-pdf-converter/2.3.1 اگر براتون مقدوره به ریپازیتوری گیت هاب پکیج ستاره بدین https://github.com/mahdiramezanii/persian_pdf_converter

Danial Ebrat سلام! امیدوارم حال دلتون خوب باشه 😊 بالاخره بعد از این همه مدت گفتم این رو براتون آمادش کنم! یه نرم افزار ساده نوشتم که میتونه به صورت خودکار از لیست اساتید مورد نظر، متناسب با فیلد تحقیقاتی هر استاد، متن ایمیل و رزومه ی مربوط به اون فیلد رو انتخاب کنه، اسم استاد، دانشگاه و گروهش رو در متن ایمیل جایگذاری کنه، رزومه، و در صورت نیاز دانشنامه رو هم ضمیمه کنه و با عنوانی مشخص، ایمیل رو برای استاد ارسال کنه. 💥 برای دانیال های بعدی در مسیر مهاجرت تحصیلی، اینجوری دیگه تمرکزتون میتونه تنها روی پیدا کردن استاد مناسب با فیلدتون باشه به جای وقت گذاشتن برای ایمیل زدن. . من با استفاده از این نرم افزار حدود حدود 30-40 تا مصاحبه گرفتم که در نهایت منجر شد به ۶ پذیرش برای پوزیشن های دکترا. . ، البته، از کیفیت ایمیل هم غافل نشید! مثل تکه های پازل، سعی کنید هر تکه رو به بهترین شکل ممکن در بیارید. . تمام اطلاعات رو میتونید از صفحه ی گیتهاب پروژه بخونید، و در این ویدیو میتونین طریقه ی استفاده از این نرم افزار رو ببینید . امیدوارم این نرم افزار مسیرتون رو هموار تر کنه. اگر وقت کنم (که اصلا معلوم نیست کی) بهتون هم یاد میدم اصلا این ایمیل ها رو از کجا پیدا کنید. روش هایی که تجربی یاد گرفتم و احتمالا تا حالا نشنیدین. کم و کاستی ها رو ببخشید، سعی کردم با کمال گرایی مبارزه کنم و در ویدیو یوتیوب مشکلات مشخص هست. 😄 با تشکر از احسان برای ایده ی قشنگش که پایه گذار اصلی به وجود آمدن این پروژه بود ❤️ Ehsan Barkhordar لینک ویدئو

نرم‌افزاری ساده و کاربردی برای تولید کد ملی ایرانی با پایتون! این ابزار به شما امکان می‌دهد تا با استفاده از دستورات CMD و زبان برنامه‌نویسی پایتون، به‌راحتی کد ملی‌های معتبر و صحیح بسازید. این پروژه می‌تواند برای تست واحد (Unit Testing) و تولید داده‌های تصادفی در پروژه‌های مختلف مورد استفاده قرار گیرد. لینک گیتهاب را برای اطلاعات بیشتر مشاهده کنید. 📱 GitHub Repo

این پروژه یک مجموعه ابزارهای پردازش متن فارسی پایه رو در اختیار شما قرار می‌ده. با استفاده از این ابزارها می‌تونید کارهایی مثل توکن‌سازی، نرمال‌سازی، استمینگ و حذف توقف‌کلمات رو برای متون فارسی انجام بدید. این ابزارها برای پروژه‌های مرتبط با پردازش زبان طبیعی (NLP) و تحلیل متن بسیار کاربردی هستن. همراه با توضیح و مستندات کامل، این پروژه مناسب برای محققان، توسعه‌دهندگان و علاقه‌مندان به حوزه پردازش زبان فارسی است. 📱 GitHub Repo

ی دیتاست نو و جالب، تصاویری از سطح جاده های ایران با برچسب 📱 GitHub Repo

این مجموعه داده شامل بیش از 5800 توییت فارسی است که با دقت برچسب‌گذاری شده‌اند (برای تشخیص کنایه) تا موضع کاربران در مورد موضوعات خاص را مشخص کند. این دیتاست به ویژه برای پژوهش‌های مرتبط با پردازش زبان طبیعی (NLP) و تحلیل احساسات کاربرد دارد. از این دیتاست می‌توان در پروژه‌های مختلفی از جمله خلق مدل‌های یادگیری ماشینی برای تشخیص موضع و تحلیل احساسات متون فارسی استفاده کرد. 📱 GitHub Repo

یه دیتاست جامع و متنوع شامل متون فارسی تحت عنوان «جام جم کورپوس»، این مجموعه داده حاوی متون فارسی از سایت جام جم هست. این دیتاست می‌تواند برای پروژه‌های پردازش زبان طبیعی (NLP) و ساخت مدل‌های یادگیری ماشین مورد استفاده قرار گیرد. اگر در حوزه‌هایی مثل تشخیص احساسات، خلاصه‌سازی متون یا ترجمه ماشینی فعالیت می‌کنید، این دیتاست می‌تونه بسیار کاربردی باشه. 📱 GitHub Repo

The data was meticulously collected from Telegram, focusing on public channels. These channels were identified and curated by our team of agents, dedicated to exploring and discovering relevant content. Dataset Statistics: Largest Available Corpus to Date Average Length of Document: 46 tokens Number of Documents: 188,874,296 Number of Channels Scraped: 58,000 Uncompressed Size: 123 GB Channels List: Available in channels.json 📱 GitHub Repo

ترجمه سایت محبوب w3schools این مخزن شامل مجموعه‌ای جامع از نکات و دستورالعمل‌های پایه‌ای پایتون به زبان فارسی است. مناسب برای کسانی که تازه وارد دنیای برنامه‌نویسی شده‌اند یا به دنبال تمرین و تقویت مهارت‌های اولیه خود در پایتون هستند. با این مخزن می‌توانید مباحث مختلف شامل متغیرها، توابع، حلقه‌ها و استثناها را به طریقی ساده و روان یاد بگیرید. مناسب برای دانش‌آموزان، دانشجویان و هر کسی که می‌خواهد پایتون را از صفر تا صد بیاموزد و در پروژه‌های ساده خود استفاده کند. 📱 GitHub Repo

این دیتاست شامل مجموعه‌ای از داده‌های فینگلیش (فارسی با الفبای لاتین) می‌باشد که برای استفاده در پروژه‌های تحلیل متن و پردازش زبان طبیعی بسیار مفید است. دیتاست شامل ۲۰۰۰ جمله و بیش از ۵۰۰۰ کلمه مختلف است که از منابع مختلف جمع‌آوری شده‌اند. از این مجموعه داده می‌توان در پروژه‌های تبدیل فینگلیش به فارسی، ساخت مدل‌های زبانی، و حتی بهبود سیستم‌های پیشنهاد دهنده کلمات استفاده کرد. 📱 GitHub Repo

PHate is a Persian multi-label hate speech dataset curated for hate speech detection tasks. It includes annotations with annotator rationales, providing valuable insights into the annotators' decision-making process. The dataset comprises 7K data. 📱 GitHub Repo

مجموعه تصاویری از جملات فارسی، شامل 2000 تصویر با کیفیت بالا که حاوی متون فارسی در سبک‌ها و فونت‌های مختلف هستند. این دیتاست برای پروژه‌های پردازش تصویر، OCR و تحلیل متون بسیار مفید است. هدف از ایجاد این مجموعه، ارائه منبعی غنی برای تحقیق و توسعه الگوریتم‌های تشخیص و خواندن متون فارسی در تصاویر است. 📱 GitHub Repo