مهندسی داده
Open in Telegram
BigData.ir کانال رسمی وب سایت ارتباط با ادمین: @smbanaei گروه تخصصی مهندسی داده 👇 https://t.me/joinchat/TjHYE4Lfrc1jZWVk کانال مهندسی داده از مطالب تخصصی و آگهی های شغلی مرتبط با حوزه زیرساخت داده، برای بازنشر رایگان در این کانال استقبال میکند.
Show moreThe country is not specifiedThe category is not specified
364
Subscribers
No data24 hours
No data7 days
No data30 days
Data loading in progress...
Similar Channels
No data
Any problems? Please refresh the page or contact our support manager.
Tags Cloud
No data
Any problems? Please refresh the page or contact our support manager.
Incoming and Outgoing Mentions
---
---
---
---
---
---
Attracting Subscribers
November '22
November '22
+3
in 0 channels
October '220
in 0 channels
Get PRO
September '22
+7
in 0 channels
Get PRO
August '22
+10
in 0 channels
Get PRO
July '220
in 0 channels
Get PRO
June '220
in 0 channels
Get PRO
May '22
+2
in 0 channels
Get PRO
April '22
+2
in 0 channels
Get PRO
March '22
+5
in 0 channels
Get PRO
February '22
+1
in 0 channels
Get PRO
January '22
+13
in 0 channels
Get PRO
December '21
+9
in 0 channels
Get PRO
November '21
+3
in 0 channels
Get PRO
October '21
+8
in 0 channels
Get PRO
September '21
+9
in 0 channels
Get PRO
August '21
+13
in 0 channels
Get PRO
July '21
+4
in 0 channels
Get PRO
June '21
+5
in 0 channels
Get PRO
May '21
+9
in 0 channels
Get PRO
April '21
+310
in 0 channels
Channel Posts
Repost from PaaSino
⚪️ آموزش عملی داکر
❇️ در این دوره قراره با داکر به عنوان یک برنامهنویس کار کنیم. قدم به قدم جلو میریم و با داکر و امکاناتش آشنا میشیم.
پروژهای که روش کار میکنیم یک اپ جنگو هست که به یک دیتابیس پستگرس متصل میشه.
🔹 قسمت اول - داستان کانتینرها
🎥 https://www.aparat.com/v/FRvmb
🔹 قسمت دوم - کار با ایمیجها و بیلد ایمیج
🎥 https://www.aparat.com/v/kMcRz
🔹 قسمت سوم - اجرای کانتینرها با داکر
🎥 https://www.aparat.com/v/XcsD6
🔹 قسمت چهارم - کار با والیوم در داکر
🎥 https://www.aparat.com/v/6jyek
🔹 قسمت پنجم - استفاده از کش هنگام بیلد ایمیج
🎥 https://www.aparat.com/v/jAvQV
این لیست به روز رسانی میشه
#docker
🆔 @paasino
| 2 | کارگاه یکساعته ای را برای معرفی و کار با دیتابیس تحلیلی آپاچی دروید به میزبانی موسسه نیک آموز به مناسبت یلدای ۱۴۰۰ برگزار کرده ام که فیلم این کارگاه در سه قسمت (معرفی / کارگاه عملی / پرسش و پاسخ ) تدوین و آماده استفاده علاقه مندان گردیده است.
اگر به این حوزه علاقه مند هستید میتوانید بعد از مشاهده این کارگاه یکساعته (سعی کرده ام خیلی خلاصه و مختصر آنرا برگزار کنم ) که لینک دو بخش ابتدایی آنرا در بالا مشاهده میکنید، فایلهای کارگاه شامل کدهای پایتون تولید داده های فیک در کافکا و داکر کامپوز مربوطه را از آدرس زیر دریافت و خودتان به کار با این دیتابیس آینده دار بپردازید :
https://github.com/irbigdata/workshops | 558 |
| 3 | https://www.aparat.com/v/UYesn | 297 |
| 4 | https://www.aparat.com/v/W03Jn | 277 |
| 5 | چندی پیش وقتی گزارش Oreilly راجع به دستمزدها و پرداختی های حوزه پردازش داده/هوش مصنوعی را بررسی می کردم در بخش کتابخانه های پایتون که آشنایی با آنها بیشترین درآمد را برای متخصصین این حوزه به همراه دارد، به کتابخانه Ray برخوردم که حقوق متوسط ۱۹۰ هزار دلاری برای آن، وسوسه انگیز به نظر میرسید و نشان میداد که بازار به این پروژه متن باز نیاز دارد. اما اینکه دقیقا چه مشکلی را این کتابخانه حل کرده است در نگاه نخست، به چشمم نیامد.
با بررسی اولیه این پروژه که کتابخانه های آن برای پایتون، جاوا و ++C در دسترس است، متوجه شدم که هدف اصلی آن، اجرای توزیع شده کدهای مرتبط با پردازش داده و بویژه انجام کارهای یادگیری ماشین بر این مبناست.
با توجه به وجود چارچوب های به نسبت جاافتاده و قدیمی این حوزه مانند اسپارک و فلینک، رواج یک فریمورک جدید و آن هم در این سطح، کمی برایم تعجب آور بود. با بررسی مثالهای موجود در مستندات رسمی Ray، دلیل اصلی این محبوبیت (البته از نقطه نظر بنده) را یافتم. با توجه به اینکه در آینده ای نزدیک از این کتابخانه، در ادبیات حوزه پردازش داده زیاد خواهید شنید، تصمیم گرفتم این تجربه را با شما هم اشتراک بگذارم.
اگر با اسپارک و هدوپ آشنا باشید، میدانید که این دو فریمورک پردازش توزیع شده داده ها که اولی جزء اصلی ترین بازیگران این حوزه هم محسوب می شود، علیرغم امکانات فراوان و سرعتی که با خود به همراه می آورند، یک ضعف بزرگ دارند و آن هم این است که باید برنامه های موجود خود را با استانداردهای آنها تطبیق دهید یعنی به سبک آنها کدنویسی کنید. قدم اول هم در این راستا، این است که توسعه دهندگان شما با اسپارک (یا فلینک یا آپاچی بیم) و نحوه برنامه نویسی با آن، آشنا شوند که این موضوع، خود مانعی بزرگ برای تیم های مختلفی است که فرصت آموزش یا نیروی ماهرِ آشنا به مباحث پردازش توزیع شده داده ها را ندارند.
فریمورک Ray این مانع را به درستی تشخیص داده است و دلیل محبوبیت و رواج آن هم به نظرم، همین نکته کلیدی است.
Ray به شما اجازه میدهد همان سبک برنامه نویسی معمولی خود را ادامه دهید و فقط با اضافه کردن یک خط کد در ابتدای تعریف تابع یا کلاس (از طریق دکوراتورها)و یک تغییر کوچک در هنگام فراخوانی این توابع، آنها را برای شما به صورت توزیع شده اجرا کند و نتیجه را به شما برگرداند.
--------------------------------------
اگر به این موضوع علاقه مند شدید، ادامه مقاله را می توانید در وب سایت مهندسی داده در لینک زیر،پیگیری کنید
yun.ir/mqf6ge
#مهندسی_داده #RAY #پردازش_توزیع_شده | 698 |
| 6 | علاقه مندان حوزه مهندسی داده و مباحث زیرساختی پردازش و طراحی خطوط انتقال داده که روز بروز بر تعداد آنها افزوده میشود، از کمبود منابع آموزشی مناسب در این خصوص گله مند هستند و این کمبود را مانعی جدی در شروع به کار حرفه ای در این مسیر شغلی می دانند.
هر چند به نوبه خودم سعی کردم با طراحی و برگزاری دوره مهندسی داده با همکاری موسسه وزین نیک آموز، تا حدودی این کمبود در منابع فارسی را جبران کنم اما مطمئنا برای پیدا کردن تسلط نسبی از طریق انجام پروژه های متنوع و نیز احترام گذاشتن به سلایق افراد مختلف در این حوزه، نیاز خواهیم داشت که منابع آموزشی متنوع و با کیفیتی در دسترس مشتاقان مهندسی داده قرار داشته باشد .
در چند سال گذشته و بخصوص در یکسال اخیر، دوره های آموزشی مهندسی داده را دنیا رصد کرده ام و تنها دوره ای که از لحاظ جامعیت، سبک و پلتفرم ارائه، توجه بنده را به خودش جلب کرده است دوره مهندسی داده وب سایت معروف کورسرا است که با حمایت یکی از قدیمی ترین غول های فناوری اطلاعات آمریکا یعنی IBM ارائه میشود.
https://www.coursera.org/professional-certificates/ibm-data-engineer
این دوره که خود از سیزده کورس مختلف آموزشی تشکیل شده است، با شروع از پایتون و کار با دیتابیس های رابطه ای، به صورت پایه ای به آموزش مفاهیم مورد نیاز مهندسین داده می پردازد . دوره های آموزشی مندرج در این برنامه از قرار زیر هستند :
مقدمه ای بر مهندسی داده
پایتون برای علم داده، یادگیری ماشین و توسعه نرم افزار
پروژه پایتون برای مهندسی داده
مقدمه ای بر بانکهای اطلاعاتی رابطه ای
دیتابیس و SQL برای علم داده (پایتون)
مقدمه ای بر دیتابیس های NoSQL
مقدمه ای بر بیگ دیتا – آشنایی با هدوپ و اسپارک
مهندسی داده و یادگیری ماشین با اسپارک
مقدمه ای بر دستورات لینوکس و اسکریپت نویسی خط فرمان
مدیریت دیتابیس های رابطه ای
ای تی ال(ETL) و خطوط انتقال داده به کمک کافکا و ایرفلو
شروع کار با انباره های داده
پروژه نهایی
همانطور که می بینید سرفصل بسیار جامع و کاملی دارد و غیر از مسایلی مانند مدیریت لاگ و داده های Observability و دیتابیس های تحلیلی نوین مثل دروید، پینوت و کلیک هوس، سایر مباحث دوره ، مسایل اساسی حوزه مهندسی داده را پوشش میدهد.
شرکت در این دوره ها رایگان است (البته هنگام Enrolment یا ثبت نام باید گزینه Audit را انتخاب کنید ) اما امکانات کامل این وب سایت آموزشی مانند دادن گواهینامه و یا تصحیح تمرینات، نیاز به پرداخت هزینه خواهد داشت. البته می توانید درخواست حمایت مالی بدهید و دوره ها را به صورت کاملا رایگان و با تمام امکانات، دریافت کنید که در یوتیوب فارسی، چندین فیلم مختلف در رابطه با نحوه دریافت این کمک های مالی خواهید یافت. | 399 |
| 7 | مهندسی داده چگونه کار میکند ؟
یک موشن گرافیک کامل و کوتاه از فرآیندهای روزانه یک مهندس داده
لینک مقاله در وب سایت مهندسی داده :
yun.ir/4d6vc6
لینک ویدئو در آپارات :
https://aparat.com/v/ZFCvw | 576 |
| 8 | مدرسه تکمیلی دانشکده مهندسی و علوم کامپیوتر دانشگاه شهید بهشتی با همکاری سحاب (sahab.ir) برگزار میکند:
دوره ۴۵ ساعته مهندسی داده به همراه پروژه های عملی
📝سرفصلهای دوره:
- مفاهیم مهندسی داده
- ذخیرهسازی و بازیابی داده توزیع شده
- پردازش دستهای و جویباری
- کار عملی با ابزارهای HBase / MapReduce / Spark / HDFS / Kafka
👤مدرسین:
سید محمد غفاریان، دکترای مهندسی کامپیوتر از دانشگاه صنعتی امیرکبیر
مهدی صفرنژاد، دکترای مهندسی کامپیوتر از دانشگاه صنعتی شریف
محمدحمزهئی، دکترای مهندسی کامپیوتر از دانشگاه علم و صنعت ایران
⏰زمان:
چهارشنبهها ساعت ۱۵:۰۰ الی ۱۸:۰۰ شروع از ۷ مهرماه
ثبتنام:
در سامانه انتخاب واحد گلستان همزمان با انتخاب واحد
*امکان اخذ درس به طور اختیاری برای دانشجویان سایر دانشکده های دانشگاه شهید بهشتی نیز فراهم است.
#BigData #Java #Spark | 327 |
| 9 | The Report | 218 |
| 10 | Data+Reort | 273 |
| 11 | چند ماه پیش به عنوان یک کار جنبی سعی کردم بررسی سریعی روی چند دیتابیس مطرح حوزه تحلیل دادهها در حجم کلان یعنی کلیکهوس، آپاچی دروید و آپاچی پینوت انجام بدهم و با محوریت پستگرس به عنوان راه حل فعلی، میزان بهبود حاصل از جایگزینی این دیتابیس عملیاتی محبوب با نمونه های تحلیلی و نوین این حوزه را به صورت عملی اندازه گیری کنم.
گزارش زیر حاصل این تلاش برای بررسی سریع (برای یک بررسی جامع باید مسایل زیادی در نظر گرفته شود ) این سه دیتابیس است که سعی کرده ام تمام مراحل نصب و راه اندازی و طراجی جداول و اجرای کوئری ها در هر کدام از آنها را با جزییات توضیح بدهم.
امیدوارم این گزارش فنی ، برای علاقه مندان مفید باشد .
👇👇👇👇 | 216 |
| 12 | Picture1.png | 1 |
| 13 | در این مقاله مروری شده است بر فناوری های حوزه مهندسی داده / مهندسی یادگیری ماشین در سال جاری که لیست تقریبا کاملی است از آنچه امروز در حوزه زیرساخت داده در حال جریان است.
https://medium.com/technexthere/data-engineering-technologies-2021-8f46bb284474
- RAPIDS, Data Science on GPU.
- Apache HOP, Facilitate all aspects of data and metadata orchestration.
- DASK, Data Science purely on Python.
- Trino, aka PrestoSQL. With clear separation from Presto, now Trino can focus heavily on features.
- The Kubeflow project is dedicated to making deployments of machine learning (ML) workflows on Kubernetes simple, portable and scalable
- Dagster, A data orchestrator for machine learning, very Programming based & in a similar space to Airflow but emphasize State flow
- lakeFS enables you to manage your data lake the way you manage your code. Run parallel pipelines for experimentation and CI/CD for your data.
- Apache Calcite, Framework for building SQL databases and data management systems without owning Data. Hive, Flink, and others use Calcite.
- maiot-ZenML, Open Sourced MLOps Framework, having a bit of everything.
- Apache Superset, Open Source BI with many connectors available.
- Metabase, An Open Source BI with amazing Visualization.
- Hopswork, Open Sourced MLOPs Feature Store.
- Apache Iceberg is an open table format for huge analytic datasets.
- Feast, open-source feature store, now with Tecton.
- MLFlow, Machine Learning Platform
- Pachyderm, MLOps Platform, in the space of MLFlow.
- Montecarlodata, Data Governance or Data Discovery or Data Observability.
- Starburst, Unlock the value of distributed data by making it fast and easy to access
- Tecton, Enterprise Feature Store.
- Fiddler, Enterprise Explainable AI.
- Cnvrg, Enterprise MLOps
- Apache Pinot, real-time distributed OLAP datastore. Its growth is amazing & It is in a similar space to Druid, but not Exactly!
- Beam, Implement batch and streaming data processing jobs that run on any execution engine.
- Databricks, with new SQL Analytics and Lakehouse paper, expecting more amazing OSS.
- Delta Lake, ACID on Apache Spark
- Koalas, Pandas on Apache Spark.
- Ray, Distributed Machine Learning and now Streaming.
- Anodot, Monitors all your data in real-time for lightning-fast detection of the incidents.
- Data Robot, Solid ML Platform with a strong focus in Enterprise MLOps.
- Dataiku, Enterprise AI/MLOps Platform.
- Fivetran, Data Integration Pipeline.
- DataFrame Whale is a straightforward data discovery tool.
- Nextflow, Data-driven computational pipelines designed for BioInformatics but can go beyond.
- Getdbt, It’s hitting the sweet spot of Apache Spark by bringing a Simplified SQL-based pipeline!
- Prefect, Designed to make Workflow Management easier & better compared to Apache Airflow.
- DVC, Open-source Version Control System for Machine Learning Projects & desired for MLOps.
- Great_Expectations, Data Science Testing framework, it’s already amazing!
- Amundsen, An Open Sourced data discovery and metadata engine.
- Marquez, Open Source Metadata with an amazing UI.
- Confluent, Apache Kafka & following Ecosystem
- Papermill, Parameterizing a Notebook, makes Data Science more interesting and easier.
- Algorithmia, Enterprise MLOps.
- Apache Hudi brings transactions, record-level updates/deletes, and change streams to data lakes!
- Abacus AI, Enterprise AI with AutoML, similar space of Data Robot.
Thanks to : https://github.com/abhishek-ch/around-dataengineering | 63 |
| 14 | درود
داستان از اونجا شروع شد که یک متخصص امنیت و یک متخصص دیتاساینس تصمیم گرفتن آخر هفتهی خودشون رو با هم بگذرونند! ایده اصلی این بود که بینیم چندتا حالت محتمل برای کد ملی وجود داره و ازشون Rainbow Table بسازیم. اینطوری کدملی ایرانی هایی که حتی متولد هم نشدند رو میتونیم داشته باشیم و اگر کسی (خدایی نکرده!) پسوردش رو کد ملیش انتخاب کرده باشه به راحتی پسوردش شکسته میشه.
https://vrgl.ir/m5FOE
@data_hub_ir | 222 |
| 15 | سلام و شب بخیر . کاش سوالتون را عمومی پرسیده بودین که سایر دوستان هم نظرشون را میگفتن. نکته اول اینکه کلیک هوس و هایو خیلی شبیه به هم نیستن. اولی یک دیتابیس تحلیلی هست و دومی (یعنی هایو) یک موتور تبدیل SQL به پردازشهای مپ ردیوس هدوپ و اجرای اونها روی فایلهای متنی (روال معمول )
بنابراین برای ساخت دریاچه داده ، که شکل خام داده ها قراره ذخیره بشه انتخاب هایو یک انتخاب کلاسیک هست به این صورت که داده ها را به صورت خام و در قالب فایلهایی تعریف میکنیم و به کمک هایو، دستورات مختلف را برروی آنها اجرا میکنیم . اما برای این کار سراغ کلیک هوس نمی ریم. چون کلیک هوس برای ذخیره داده های تحلیلی استفاده میشه ( یعنی دادههایی که قراره انواع گزارشات آماری از اونها گرفته بشه ) و یک نوع دیتابیس محسوب میشه .
اما امروزه اگر قرار باشه که داده ها را به شکل خام ذخیره کنیم، توصیه بنده استفاده از ترینو به جای هایو هست که وابستگی به هدوپ هم نداره و امکانات خیلی بیشتری در اختیارتون میذاره و بین شرکتهای مختلف هم خیلی رایجه .
برای ذخیره خود فایلها به شکل خام هم ترجیح من استفاده از Apache Iceberg هست که هم شکل خام داده ها و فایلها حفظ میشه و هم یک متادیتا راجع به اونها ذخیره میشه تا پردازش بعدی اونها سریعتر و موثرتر باشه .
این مقاله را توصیه میکنم اگر قصد ساخت دریاچه داده را دارید حتما بخونید :
https://medium.com/expedia-group-tech/a-short-introduction-to-apache-iceberg-d34f628b6799
توی این مقاله، از هدوپ کاتالوگ یا هایوکاتالوگ استفاده شده که فقط برای ذخیره متادیتا به کار میره و خود هایو یا هدوپ به کار گرفته نمیشه ..
در صورت استفاده از آیس برگ برای ذخیره فایلها، میتونید به راحتی ترینو را از طریق کانکتور اختصاصی اون به فایلهاتون متصل کنید و انواع کوئری های اس کیو ال را روی اونها به راحتی اجرا کنید و به کمک ترینو، حتی دستور اینزرت برای ذخیره داده های جدید در قالب فایل های خام - پارکت یا ORC با استاندارد Icerberg را هم اجرا کنید - مثالهای زیر را در وب سایت رسمی ترینو مشاهده کنید :
https://trino.io/docs/current/connector/iceberg.html ) | 32 |
| 16 | @smbanaei
سلام، وقتتون بخیر
آقای مهندس در معماری های دریاچه داده از نظر شما برای انبار داده hive مناسب هست یا click house؟ و آیا اصلا با یکدیگر قابل مقایسه هستند؟ | 30 |
| 17 | کتاب مهندسی داده با پایتون | 275 |
| 18 | فایل الکترونیکی مهندسی داده با پایتون که با نرم افزارهایی مانند Calibre قابل مشاهده است
https://calibre-ebook.com/download
👆👆👆👆👆👆 | 262 |
| 19 | کتابهای بسیار کمی در حوزه مهندسی داده در سالیان اخیر منتشر شده است و برای علاقهمندان این حوزه، عدم وجود منابع مناسب جزء محدودیتهای اصلی شروع کار در این زمینه رو به رشد است.
اخیراً انتشارات
Packt
کتابی با عنوان
Data Engineering With Python
منتشر کرده است که مباحث مختلفی با محوریت
Apache Nifi
و به صورت کاملا عملی و کاربردی، در آن مطرح شده است .
در این کتاب با مطالب زیر آشنا خواهید شد :
- پایتون و نحوه کار با دادهها در پایتون .
- آپاچی نایفای
- پستگرس
- الستیک سرچ
- آپاچی ایرفلو
- Greate Expectations
- اسپارک
- مانیتورینگ و مدیریت خطاها
- آپاچی کافکا
هر چند مباحث زیادی هم در این کتاب مطرح نشده است -مانند انواع روشهای
ETL،
دیتابیسهای تحلیلی، خط فرمان لینوکس و داکر ، …. - اما نقطه شروع مناسبی در حوزه یادگیری مهندسی داده است .
برای دانلود نسخه EPUB این کتاب به لینک زیر مراجعه کنید
https://jp.b-ok.as/book/6100128/e54687 | 274 |
| 20 | BigData-Final-Project-With-Solutions.pdf | 2 437 |
