مهندسی و علم داده
前往频道在 Telegram
در مورد ادمین کانال : - محمد عالیشاهی - دکترای هوش مصنوعی دانشگاه تهران - مدیر ارشد پروژه های هوش مصنوعی و علم داده -دبیر شورای حکمرانی داده انجمن هوش مصنوعی ایران
显示更多3 978
订阅者
+124 小时
+47 天
-730 天
帖子存档
3 978
نکته مهم همینجاست:
100M Records ≠ 100M Records Read
به همین دلیل:
• Partitioning
• ORDER BY
• Data Layout
در ClickHouse فقط تصمیمهای مربوط به Storage نیستند؛ مستقیماً روی Performance Query اثر میگذارند.
پس وقتی یک Query کند است، قبل از اینکه سراغ CPU و RAM برویم، بهتر است یک سؤال ساده بپرسیم:
«چرا این همه داده دارد خوانده میشود؟»
در بسیاری از سیستمهای تحلیلی، سریعتر شدن Query از پردازش بیشتر شروع نمیشود؛ از خواندن کمتر داده شروع میشود.
Less Data Read → Less I/O → Less CPU Work → Faster Query
@BIMining
3 978
چطور ClickHouse روی 100 میلیون رکورد Query اجرا میکند، بدون اینکه 100 میلیون رکورد را بخواند؟
وقتی صحبت از Performance در سیستمهای تحلیلی میشود، معمولاً ذهنمان میرود سمت:
• CPU
• RAM
• سرعت Disk
اما در ClickHouse یک سؤال مهمتر وجود دارد:
چقدر از داده واقعاً لازم است خوانده شود؟
فرض کنید Query فقط به اطلاعات 24 ساعت اخیر و چند Column مشخص نیاز دارد.
و ClickHouse قرار نیست کل داده را بخواند و بعد دنبال رکوردهای موردنظر بگردد.
در این فرآیند:
• ابتدا Partitionهای نامرتبط حذف میشوند.
• سپس Partهای غیرضروری کنار گذاشته میشوند.
• با Data Skipping و Metadata، بخشهایی که احتمالاً هیچ Matchای ندارند Skip میشوند.
• به دلیل Columnar Storage، فقط Columnهای موردنیاز خوانده میشوند.
• و Compression حجم I/O را کاهش میدهد.
• در نهایت Vectorized Execution دادهها را بهصورت Batch پردازش میکند.
مسیر اجرای Query میتواند چیزی شبیه این باشد:
100M Records → Pruning → Data Skipping → Required Columns → Execution → Result
@BIMining
3 978
قراردادی برای اینکه داده، قابل اعتماد بماند؛ Data Contract.
در یک سیستم داده، ممکن است یک تیم بدون اطلاع تیمهای دیگر ساختار یا معنای یک فیلد را تغییر دهد؛ Pipeline هم شاید همچنان سبز باشد، اما خروجی Dashboard یا مدل ML دیگر درست نباشد.
در چنین شرایطی، Data Contract انتظارات را از قبل مشخص میکند: ساختار داده، معنا، کیفیت، Freshness، مالکیت و قوانین تغییرات.
در واقع، میتوان Data Contract را مثل یک API برای دادهها در نظر گرفت؛ یک توافق مشخص بین کسی که داده را تولید میکند و تیمهایی که به آن داده وابستهاند.
نکته مهم اینجاست که Data Contract فقط مستندات نیست؛ میتواند بهصورت machine-readable تعریف شود و بخشی از کنترلهای کیفیت و CI/CD را بهصورت خودکار اجرا کند.
در نهایت، داده خوب فقط دادهای نیست که منتقل میشود؛ دادهای است که میدانیم قرار است چه تعهداتی را برآورده کند.
@BIMining
3 978
معماری مدالیون(Medallion Architecture)، سیر تحول دادهها را از حالت خام اولیه تا نسخهای که آمادهٔ پشتیبانی از تصمیمگیری است، سازماندهی میکند.
لایهٔ برنز (Bronze)، فایلها، رویدادها و رکوردها را دقیقاً به همان صورتی که از سیستمهای مبدأ دریافت میشوند، حفظ میکند. این لایه، سطحی از جزئیات را نگهداری میکند که برای ردیابی خطاها و بازسازی فرایندها ضروری است.
لایهٔ نقره (Silver)، دادهها را پالایش، استانداردسازی، پاکسازی (deduplicate) و اعتبارسنجی میکند. در این مرحله، فرمتها اصلاح، کدها یکسانسازی و بررسیهای کیفی روی دادهها اعمال میشوند.
لایهٔ طلا (Gold)، قوانین کسبوکار را به دادهها اضافه کرده و جداول، معیارها و محصولات دادهای را برای داشبوردها، تحلیلها و مدلهای پیشبینی آماده میسازد.
@BIMining
3 978
🔺ورود چین به عصر ایجنتهای هوش مصنوعی
🔹شرکت چینی بایت دنس با معرفی مدل Doubao 2.0 رسماً به عصر ایجنتها وارد شده و تلاش دارد جایگاه خود را در بازار رقابتی هوش مصنوعی حفظ کند. این مدل فراتر از یک چتبات است و برای انجام وظایف پیچیده دنیای واقعی طراحی شده است. نسخه Pro آن با مدلهایی مانند OpenAI و گوگل رقابت میکند.
🔹بایتدنس میگوید هزینه استفاده از Doubao 2.0 حدود ۱۰ برابر کمتر از رقبا است و این موضوع برای پردازشهای پرمصرف مزیت مهمی به شمار میرود. این شرکت پس از غافلگیری از ظهور DeepSeek حالا میخواهد از تکرار آن تجربه جلوگیری کند. در بازار چین، Doubao با ۱۵۵ میلیون کاربر هفتگی در صدر قرار دارد و سایر رقبا نیز با سرعت در حال رشد هستند.
@BIMining
3 978
برگزاری پنل هوش مصنوعی با عنوان
سنجش داده تا سناریوسازی ،زیرساخت های فناورانه،داده کاوی و طراحی مدل های پیش بینی با هوش مصنوعی
دوشنبه 24 آذرماه 1404 پاویون هوش مصنوعی مصلی امام خمینی
ساعت 11-12:15
3 978
سخنرانی با عنوان افزایش کارایی هوش مصنوعی با معماری توزیع شده کلیک هاوس
در الکامپ تاکز
@BIMining
3 978
مقایسه پلتفرم های بیگ دیتا LICKHOUSE ، Apache Druid , Apache Doris بر اساس سایت معتبر DBEngines
ClickHouse :
به وضوح بر کارایی فوقالعاده بالا و پردازش کوئریهای OLAP با حداقل زمان ممکن تمرکز دارد. استفاده از C++ و معماری ستونی (Column-oriented) این امکان را فراهم میکند.
نقطه قوت: بهترین عملکرد را برای تجمیعهای پیچیده و کوئریهای تحلیلی بر روی دادههای عظیم ارائه میدهد. پشتیبانی گسترده از زبانهای برنامهنویسی و انواع API، آن را بسیار انعطافپذیر میکند.
نقاط متمایز: تنها پلتفرمی است که در این مقایسه قابلیتهای In-memory و DBaaS (سرویس ابری مدیریت شده) را ارائه میدهد و از replication فیزیکی همزمان و غیرهمزمان با پشتیبانی از ذخیرهسازهای ابجکت بهره میبرد.
Apache Druid:
به صورت خاص برای کوئریهای OLAP زیر ثانیه بر روی دادههای با ابعاد بالا و کاردینالیتی بالا (High Dimensionality & High Cardinality) طراحی شده است.
نقطه قوت: بسیار مناسب برای دادههای سری زمانی (Time Series Data) و داشبوردهای لحظهای (Real-time Dashboards) که نیاز به پاسخگویی بسیار سریع دارند. موتور اصلی آن جاوا است.
@BIMining
3 978
چگونه RAG کار میکند:
تولید تقویتشده با بازیابی یا RAG به مدل زبان اجازه میدهد تا پاسخها را بر اساس دانش خارجی ارائه دهد، نه فقط آنچه که روی آن آموزش دیده است:
1️⃣ کاربر یک سؤال میپرسد.
ممکن است ورودی فاقد زمینه کافی باشد، مثلاً: «آیا امکان خروجی PDF دارد؟»
2️⃣ مدل زبان بزرگ (LLM) سؤال را بازنویسی میکند.
با استفاده از تاریخچه گفتگو، سؤال را به یک پرسش مستقل تبدیل میکند:
«ویژگیهای پلن Pro چیست؟ آیا میتواند PDF صادر کند؟»
3️⃣ جستجوی معنایی فعال میشود.
پرسش مستقل به صورت برداری تبدیل شده و با بخشهای موجود در اسناد از طریق شباهت برداری مقایسه میشود.
4️⃣ پرامپت (ورودی مدل) ساخته میشود.
سیستم مرتبطترین بخشها را جمعآوری و آنها را در قالب پرامپتی ساختارمند قرار میدهد. این مرحله توسط یک زنجیره پرسش و پاسخ (QA Chain) انجام میشود که ترکیب میکند:
▪️ پرسش مستقل
▪️ زمینه بازیابی شده
▪️ قالب پاسخ
5️⃣ مدل زبان بزرگ پرامپت کامل را با دانش خارجی استدلال کند، حتی اگر روی آن آموزش ندیده باشد.
6️⃣ پاسخ نهایی تولید میشود.
پاسخ بر اساس اسناد بازیابی شده است، نه فقط حافظه داخلی مدل.
3 978
در سال ۲۰۳۰ واقعاً چه چیزی اهمیت خواهد داشت؟
این نمودار یک تغییر چشمگیر را نشان میدهد:
راهبرد، سازگاری و تسلط بر فناوری به سرعت در حال رشد هستند ، در حالی که مهارتهای سنتی مانند کنترل کیفیت، آموزش و حتی برنامهنویسی در اولویت پایینتری قرار میگیرند.
چرا؟ چون هوش مصنوعی در حال بازنویسی قواعد بازی است.
کارفرمایان دیگر فقط به دنبال «مهارت» به معنای سنتی آن نیستند آنها به دنبال افرادی هستند که در این موارد برجسته باشند:
→ تفکر تحلیلی
→ تابآوری، انعطافپذیری و چابکی
→ رهبری و تأثیرگذاری اجتماعی
→ انگیزه و خودآگاهی
→ تفکر خلاق
→ تفکر سیستمی
→ کنجکاوی و یادگیری مادامالعمر
این دقیقاً همان جایی است که چارچوب شایستگی جدید ما با عنوان «پنجگانه بزرگ راهبردی» وارد میشود. این فقط یک چارچوب یا مجموعهای از مهارتهای نرم و سخت نیست—بلکه مجموعهای متمرکز از مهارتهای قدرتمند است که برای دنیای پر از عدم قطعیت و تغییر طراحی شدهاند.
@BIMining
