Database
Open in Telegram
🕸 Database Academy حمایت مالی: https://www.coffeete.ir/mrbardia72 ادمین: @mrbardia72
Show more883
Subscribers
No data24 hours
No data7 days
+3630 days
Posts Archive
884
🔵 عنوان مقاله
The NULL in your NOT IN (13 minute read)
🟢 خلاصه مقاله:
در پایگاه دادههای PostgreSQL، استفاده از عبارت NOT IN یکی از مواردی است که معمولاً با مشکلات و ابهامات زیادی همراه است. یکی از اصلیترین مشکلات این است که اگر در زیرپرس و جو یا بخش سمت چپ این عبارت، حتی یک مقدار NULL وجود داشته باشد، نتیجه کلی پرسوجو به طور غیرمنتظرهای صفر سطر برمیگردد. این مسأله بر پایه منطق سهارزشی است که در آن، NULL نشاندهندهی نبود اطلاعات قطعی است و باعث میشود رفتار عملگرهای منطقی در این زمینه کمی متفاوت شود.
برای درک بهتر، زمانی که در بخش شکلدهنده پرسوجو NULL وجود داشته باشد، هر مقایسهای که با آن NULL صورت گیرد، نتیجهاش نامشخص میزند و این موضوع میتواند منجر به این شود که نتیجه نهایی پرسوجو به جای مقادیر مورد انتظار، هیچ نتیجهای نداشته باشد. به همین دلیل، درک این نکته مهم است که حتی یک NULL در زیرپرسوجو یا لیستهای موجود در NOT IN، میتواند منجر به غیرفعال شدن کلی نتیجهها شود و سطرهای مورد انتظار نمایش داده نشود.
در نهایت، حل این مشکل نیازمند دقت و آگاهی بیشتر در نوشتن کوئریهای PostgreSQL است. راهکارهای مختلفی برای مقابله با این چالش وجود دارد، مانند استفاده از عبارات جایگزین، کار با IS NULL، یا اصلاح ساختار کوئریها برای به حداقل رساندن تأثیر NULLها و تضمین عملکرد صحیح پرسوجوها، به طوری که نتایج منطبق بر انتظار کاربر باشد و هیچ نتیجهی غیرمنتظرهای به خاطر NULL رخ ندهد.
#پایگاه_داده #PostgreSQL #SQL #نکات_برتر
🟣لینک مقاله:
https://boringsql.com/posts/not-in-null/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
switched to permanent daylight saving time
🟢 خلاصه مقاله:
در ماه مارس، کشورها و مناطق مختلف به صورت رسمی ساعت خود را به وقت دائم تابستانی تغییر میدهند. این تغییر، علاوه بر تاثیر بر زندگی روزمره مردم، نشاندهندهی چالشهایی است که در مدیریت دادههای زمانبندی به خصوص در سیستمهای دیجیتال ایجاد میکند. یکی از مهمترین موارد، مشکل مربوط به ذخیرهسازی زمان محلی قبل از بهروزرسانی دادههای منطقهای (tzdata) است که ممکن است باعث سردرگمی در ثبت و بازیابی زمان صحیح شود.
وقتی که دادههای زمانی قبل از اعمال تغییرات مربوط به ساعت تابستانی ثبت شده باشند، و در آینده بعد از بهروزرسانی tzdata، این تاریخها بدون اصلاح باقی بمانند، نتیجه این است که سیستم زمان محلی اشتباه میشود. به عبارت دیگر، زمانهایی که در آن لحظه ثبت شده بودند، اشتباه نشان داده میشوند و این میتواند مشکلات جدی در برنامههای حساس به زمان ایجاد کند، مانند سوابق مالی، برنامههای میاننهادی، و سیستمهای ناوبری یا اطلاعاتی.
برای جلوگیری از این مشکل، باید راهکارهایی را اتخاذ کرد، مانند بهروزرسانی منظم دادههای منطقهای قبل از تغییر ساعت رسمی، یا استفاده از انواع ثابت و بدون وابستگی به منطقه زمانی در ذخیرهسازی تاریخها. همچنین، پیروی از بهترین شیوههای برنامهنویسی و آگاهی از مهلتهای بهروزرسانی tzdata، میتواند به مدیران و توسعهدهندگان کمک کرده تا از بروز خطاهای ناخواسته جلوگیری کنند و دقت و صحت دادههای زمانی را حفظ نمایند.
در کل، این نوع مشکلات نشان میدهد که مدیریت دقیق زمان در دنیای دیجیتال نیازمند توجه ویژه است مخصوصاً در کنار رویدادهای رسمی تغییر ساعت که میتواند اثرات پیچیدهای بر سیستمهای مختلف داشته باشد. با برنامهریزی مناسب و رعایت توصیههای فنی، میتوان از مشکلات ناشی از تغییر زمان جلوگیری کرد و دادههای زمانی را همواره بهروز و دقیق نگه داشت.
#ساعت_تابستانی #مدیریت_زمان #پایش_فنی #دیتا
🟣لینک مقاله:
https://news.gov.bc.ca/releases/2026AG0013-000209
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
pg_kpart version 1.0 (2 minute read)
🟢 خلاصه مقاله:
نسخه ۱.۰ ابزار pg_kpart، یک راهکار موثر و کارآمد برای مدیریت جستجوهای جداول پارتیشنبندی شده در پایگاه دادههای PostgreSQL است. این ابزار، مانع اجرای سوالهای کامل و پرحجم بر روی جداول پارتیشنبندی شده میشود، مگر اینکه برنامهریز (planner) بتواند بر اساس کلید پارتیشن، قسمتهایی از دادهها را حذف کند. در واقع، این ویژگی باعث جلوگیری از انجام اسکنهای تصادفی و ایجاد حجم زیادی از ورودی و خروجی (I/O) میشود، و در نتیجه بر عملکرد و کارایی پایگاه داده تاثیر مثبت میگذارد.
علاوه بر این، pg_kpart امکانات مهمی مانند پشتیبانی از فرآیندهای ارزیابی امنیتی و کنترلهای دسترسی مانند پیادهسازی سیستمهای ارزیابی و گزارشدهی، و مدیریت لیستهای سفید و سیاه برای محدود کردن یا مجاز کردن دسترسی را داراست. این ابزار همچنین توانایی مدیریت خطاهای مربوط به وضعیت SQL (SQLSTATE) را دارد، که به کاربر کمک میکند خطاهای مربوط به عملیاتهای پایگاه داده را بهتر شناسایی و مدیریت کند. لازم است توجه داشت که در حال حاضر، این ابزار فقط بر روی سیستمعامل لینوکس قابل اجرا است، که نشاندهنده تمرکز آن برای کاربران این پلتفرم است.
در مجموع، pg_kpart به عنوان یک ابزار مهم و پیشرفته، امنیت و کارایی پایگاههای داده PostgreSQL را در مدیریت جداول پارتیشنبندی شده، به سطح بالاتری میبرد و به توسعهدهندگان و مدیران پایگاه داده، امکانات بهینه و قدرتمندی ارائه میدهد.
#پایگاه_داده #پارتیشن_بندی #PostgreSQL #مدیریت_داده
🟣لینک مقاله:
https://www.postgresql.org/about/news/pg_kpart-version-10-3316/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Data Processing is Becoming a GPU Workload (6 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری، فرآیندهای مربوط به پردازش دادهها به سمت استفاده بیشتر از پردازندههای گرافیکی (GPU) حرکت میکنند. در گذشته، بسیاری از عملیات پردازش دادهها براساس سیستمهای مرکزی و قدرتمند CPU انجام میشدند، به ویژه در زمینههای ETL (استخراج، تبدیل و بارگذاری دادهها) که بیشتر مبتنی بر SQL بودند. اما حالا، تمرکز به سمت بهرهگیری از توان پردازش همزمان و سریع GPU در مدلهای inference یا استنتاج تغییر یافته است، که به کمک این فناوریها، دادهها میتوانند شامل ویدئو، صدا، فایلهای PDF، پیامهای Slack و دادههای حسگری را به صورت سریع و کارآمد پردازش کنند.
این رویکرد جدید باعث شده است که مدلهای هوشمند ابتدا دادهها را مطالعه و تجزیه و تحلیل کنند، سپس اقدام به ایجاد انواع نمایههای معناشناختی، برچسبها، خلاصهها و ثبت جزئیات ساختاری در قالبهای متنوع کنند. این اطلاعات به کاربر امکان میدهد تا به کمک بانکهای اطلاعاتی مبتنی بر SQL و سیستمهای مبتنی بر بردار، دادههای ساختاریافته و غیرساختاریافته را به راحتی مدیریت و تحلیل کند. در نتیجه، پلتفرمهای فناوری در حال حرکت به سمت ترکیبی از محاسبات موازی، استریمینگ دادهها و عملیات همزمان با قابلیت درک و پاسخ سریع به APIها هستند.
تغییر اساسی در روندهای پردازش دادهها، انعطافپذیری و سرعت ارائه خدمات را در تجهیزات هوشمند و سیستمهای بزرگ افزایش میدهد، که این امر اهمیت ویژهای در توسعه سیستمهای هوشمند و تحلیلهای سریع و دقیق پیدا میکند. به طور کلی، تبدیل فرآیندهای دادهای به سمت GPU محور، آیندهای پر از فرصتهای نوآورانه در حوزه فناوریهای دادهمحور است.
#پردازش_داده #GPU #هوش_مصنوعی #فناوری
🟣لینک مقاله:
https://anyscale.com/blog/data-processing-becoming-gpu-workload?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Predicting model behavior before release by simulating deployment (6 minute read)
🟢 خلاصه مقاله:
مدلهای هوشمند روز به روز در حال توسعه و پیشرفت هستند، اما یکی از چالشهای مهم در عرضه این فناوریها، پیشبینی نحوه عملکرد آنها در محیطهای واقعی است. برای حل این مشکل، روش جدیدی به نام شبیهسازی استقرار توسط OpenAI ارائه شده است که قبل از انتشار نهایی، رفتار مدل را تا حد زیادی شبیهسازی میکند. این تکنیک، با بازپخش کردن پیشزمینههای گفتگوهای کاربران واقعی—که به صورت ناشناس جمعآوری و نگهداری شدهاند—مدلهای جدید را در محیطهای مصنوعی قرار میدهد و پاسخهای آنها را آزمایش میکند. هدف اصلی این فرآیند، ارزیابی دقیقتر و واقعیتر رفتارهای احتمالی مدل در آینده است، به گونهای که بتوان ناهنجاریها و رفتارهای ناخواسته را قبل از ارائه عمومی شناسایی و رفع کرد. این روش، نسبت به روشهای سنتی ارزیابی، امکان تخمین نرخ وقوع خطاها و رفتارهای نامناسب را با دقت بیشتری فراهم میآورد و به توسعهدهندگان کمک میکند تا قبل از عرضه، نقاط ضعف و محدودیتهای مدل را بهبود بخشند.
در نتیجه، شبیهسازی استقرار نه تنها به عنوان یک ابزار پیشرفته پیشبینی، بلکه به عنوان گامی مهم در جهت اطمینان از ایمنی و کارایی بهتر مدلهای هوشمند قبل از ورود به دنیای واقعی به حساب میآید. این فناوری نوین اهمیت زیادی در ارتقاء اعتماد و امنیت کاربران دارد و میتواند آینده توسعه هوش مصنوعی را شکل دهد.
#هوش_مصنوعی #شبیهسازی_استقرار #ایمنی_مدل #پیشبینی_نهایی
🟣لینک مقاله:
https://openai.com/index/deployment-simulation/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Fine-tuning a clinical AI model to frontier parity (8 minute read)
🟢 خلاصه مقاله:
در حوزه هوش مصنوعی بالینی، یکی از مهمترین چالشها دستیابی به سطح برابری با بهترین مدلهای جهان است. در این مقاله، بررسی میشود که چگونه تیم Heidi AI موفق شد یک مدل کوچکتر و تخصصی در زمینه بالینی را با استفاده از روشهای فاینتینینگ، به سطح برترترین مدلهای مرزی برساند. این فرآیند با انجام آزمونهای ترجیح بینام و نشان توسط پزشکان واقعی صورت گرفت، جایی که مدل توسعهیافته توانست در برابر مدلهای پیشرفتهتر، نظر پزشکان را جلب کند.
نجات این موفقیت در بهرهگیری از بازخوردهای منحصر به فرد و تخصصی پزشکان است که موجب شده است این مدل نه تنها در تئوری بلکه در عمل، عملکردی بسیار نزدیک به بهترینها داشته باشد. اضافه بر این، با پیادهسازی بررسیهای ایمنی دقیق و اقدامات حفاظتی، سطح اطمینان در تصمیمات اتخاذ شده توسط این هوش مصنوعی به نحو قابل توجهی افزایش یافته است. تمامی این فرآیندها در یک حلقه محصول منسجم و منطبق بر قضاوتهای واقعی بالینی تنظیم شده است که باعث تقویت اعتماد و کارایی سیستم شده است.
در نتیجه، این توسعه نشان میدهد که با تمرکز بر بازخوردهای تخصصی و بهبود مداوم، میتوان مدلهای هوش مصنوعی در عرصه پزشکی را به سطحی برتر ارتقا داد و نزدیک به مرزهای پیشرفتهترین فناوریها کرد. این نوآوری، الگویی است برای پیشرفتهای آینده در هوشمندسازی مراقبتهای بالینی و تضمین سلامت بیماران از طریق فناوریهای نوین.
#هوش_مصنوعی_بالینی #فاینتینینگ #مراقبت_های_سلامتی #نوآوری
🟣لینک مقاله:
https://www.heidihealth.com/blog/clinical-ai-model-fine-tuning?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
British Columbia, Time Zones, and Postgres
🟢 خلاصه مقاله:
منطقهی بریتیشکلمبیا در ماه مارس به ساعتی ثابت و دائمی درونساعت تابستانی تغییر یافته است، که این تصمیم نمونهای از یک مشکل ظریف در مدیریت زمان در پایگاههای داده است. این تغییر خاص باعث بروز یک تله مخفی در هنگام استفاده از نوع دادهی timestamptz در سیستمهای مبتنی بر پستگرس میشود. به طور خاص، زمانی که تاریخهای محلی آینده قبل از بهروزرسانی دادههای منطقه زمانی (tzdata) ذخیره شده باشند، ممکن است این تاریخها بازگردند و اشتباه یک ساعتی در نشان دادن زمان صحیح ایجاد شود.
برای جلوگیری از بروز چنین مشکلی، نیاز است که توسعهدهندگان و مدیران پایگاه داده موضوع تفاوتهای منطقه زمانی و نحوه مدیریت تغییرات دائمی در زمانها را بدانند و راهکارهای مناسب را پیادهسازی کنند. استفاده از روشهای بهروزرسانی منظم دادهها و پیروی از بهترین تمرینها در کار با timestamptz میتواند این خطاهای غیرمنتظره را کاهش دهد. با درک بهتر این جزئیات، میتوان از بروز خطاهای غیرقابل تصور در برنامههای زمانی جلوگیری کرد و دادههای زمان واقعی صحیح و قابل اعتماد داشت.
در نهایت، مدیریت صحیح منطقههای زمانی در پایگاههای داده اهمیت ویژهای دارد، بهخصوص در مناطقی مانند بریتیشکلمبیا که تغییرات دائم در ساعات تابستانی دارند. این موضوع نکتهای حیاتی است برای تیمهای توسعه و مدیران دیتابیس که میخواهند اطمینان پیدا کنند اطلاعات زمان در سیستمهایشان دقیق باقی میماند و از وقوع خطاهای ناخواسته جلوگیری کنند.
#مدیریت_زمان #postgres #منطقهزمان #دیتابیس
🟣لینک مقاله:
https://www.crunchydata.com/blog/british-columbia-and-time-zone-changes
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
pg_ducklake 1.0: A Native Lakehouse in Postgres
🟢 خلاصه مقاله:
در دنیای مدیریت دادهها، ساختارهای مختلفی برای ذخیره و پردازش اطلاعات ارائه شده است، اما یکی از نوآوریهای مهم در این حوزه، مفهوم «درونرویی دریاچه داده» یا همان «لِیکهَوس» است. این رویکرد، تلفیقی است از امکانات انبار دادههای سنتی و ماهیت انعطافپذیر دریاچههای داده، به طوری که کاربران بتوانند دادههای حجیم و مختلف را در یک ساختار منسجم و قابل دسترسی نگهداری و پردازش کنند. پروژه pg_ducklake 1.0 یک افزودنی برای پایگاه داده پوسگرس است که این مفهوم را به صورت بومی و مستقیم در داخل این سیستم قدرتمند پیادهسازی میکند.
این افزونه امکانات بینظیری از جمله ذخیرهسازی ستونی، اجرای عملیات به صورت وکتوری و معماری لِیکهَوس را در قالبی ساده و کاربرپسند به پوسگرس میآورد. با بهرهگیری از فناوریهای DuckDB و DuckLake، این افزونه امکان مدیریت بهتر و سریعتر دادهها را فراهم میآورد، به طوری که کاربران میتوانند دادههای حجیم و پیچیده را در کمترین زمان ممکن مورد تحلیل قرار دهند. طراحی این سیستم بر پایه ساختاری است که هم به کارایی بالا و هم به سهولت استفاده تمایز مییابد.
در نتیجه، pg_ducklake 1.0 پلی است میان فناوریهای پیشرفته و نیازهای روزمره تحلیل داده، و به کاربران امکاناتی بهتر، سریعتر و کاراتر برای پردازش دادههای بزرگ ارائه میدهد. این توسعه نشاندهنده روند رو به رشد ادغام فناوریهای نوین در داخل پایگاههای داده رایج است و میتواند افقهای جدیدی در حوزه دادههای بزرگ و تحلیلهای جامع بگشاید.
#پایگاه_داده #درونرویی #تحلیل_داده #فناوری_نواور
🟣لینک مقاله:
https://pgducklake.select/blog/releasing-v1/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Why We Moved from Hive-Style Data Lakes to Apache Iceberg? (12 minute read)
🟢 خلاصه مقاله:
چرا ما انتقال از دریاچه داده با سبک Hive به Apache Iceberg را ترجیح دادیم؟ این سوال، برای تیمهای داده و تحلیلگرانی که به دنبال بهبود کارایی و انعطافپذیری سیستمهای خود هستند، بسیار حائز اهمیت است. در گذشته، بسیاری از سازمانها از دریاچههای داده مبتنی بر هارد قالب Hive استفاده میکردند که عمدتاً بر روی فایلهای Parquet در سامانه S3 و با کاتالوگ AWS Glue استوار بود. این سیستمها، در طول زمان، با مشکلاتی مانند محدودیتهای درویشپذیری، ناتوانی در اصلاح ساختارهای داده و مشکلات در بروزرسانیهای اسکیمای دینامیک، مواجه شدند.
با گسترش اکوسیستم AWS و افزودن قابلیتهایی مانند پشتیبانی بهتر از جداول S3 و امکانات جدید، تیمهای داده توانستند این نواقص را کاهش دهند. در این مسیر، معرفی و توسعه Apache Iceberg به عنوان یک فرمت جدول منطبق بر استاندارد، نقطهعطف بزرگی بود. Iceberg با قابلیتهای خاصی مانند حذف کامل نگرانیهای مربوط به اصلاح اسکیمای جداول، پشتیبانی از تغییرات سریع در ساختار دادهها، امکان سفر در زمان (Time Travel) برای بازیابی نسخههای قبلی دادهها و برنامهریزی بهبود یافته در اجرای کوئریها، انقلابی در مدیریت دادهها ایجاد کرد.
در نتیجه، انتقال به Iceberg نه تنها مشکلات گذشته را برطرف کرد، بلکه کارایی عملیاتهای تحلیل و پرسوجو را هم افزایش داد. این مزایا موجب شد تا سازمانها بتوانند درک عمیقتری از دادههای خود داشته و به صورت مؤثرتری تصمیمگیری کنند. در نهایت، این تحول، نقطهی عطفی در روند مدیریت دادههای بزرگ و سیستمهای دیتا آنالیتیکس به حساب میآید.
#دیتا_مدیریت #Iceberg #تحلیل_داده #پیشرفته
🟣لینک مقاله:
https://medium.com/@rongalinaidu/why-we-moved-from-hive-style-data-lakes-to-apache-iceberg-f9f23e7a64d3?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Insights from the 2026 State of Analytics Engineering (Sponsor)
🟢 خلاصه مقاله:
در دنیای تحلیلهای داده، هوش مصنوعی به طور چشمگیری در حال تغییر نقش مهندسی تحلیل است. با این حال، سازمانها هنوز در مواجهه با چالشهایی مانند اعتماد، حاکمیت دادهها و مدیریت هزینهها، با مشکلات جدی روبرو هستند. این گزارش بر اساس تجربیات و دیدگاههای صدها حرفهای در حوزههای تحلیل داده و مهندسی داده تهیه شده است و نگاهی عمیق به روندها، اولویتها و روشهایی دارد که تیمهای داده در آینده باید بر آن تمرکز کنند. این تحلیل، راهنمایی مهم برای سازمانهایی است که میخواهند در مسیر تحول دیجیتال و بهبود کارایی دادههای خود گام بردارند و از فرصتهای نوین بهرهمند شوند.
در این گزارش، به بررسی چالشهای جاری در راهکارهای تحلیل داده و نقش مهم فناوری هوش مصنوعی در رفع آنها پرداخته شده است. همچنین، اهمیت ایجاد اعتماد و تضمین حاکمیت دادهها در کنار مدیریت هزینهها، محور اصلی بحث است. تیمهای داده باید استراتژیهایی را اتخاذ کنند که این مسائل را برطرف کرده و در عین حال، بهرهوری و کارایی پروژههای تحلیلی را افزایش دهند.
در نتیجه، این مطالعه نشان میدهد که آینده مهندسی تحلیل، نیازمند همگرایی میان فناوریهای نوین، استانداردهای حاکمیتی و رویکردهای مبتنی بر اطمینان و شفافیت است. سازمانها با بهرهگیری از این رویکردهای نوین، میتوانند رقابتیتر شده و تصمیمگیریهای خود را بر پایه دادههای دقیقتر و اعتماد بیشتر بنا کنند.
#تحلیل_داده #هوش_مصنوعی #حاکمیت_داده #مدیریت_هزینه
🟣لینک مقاله:
https://fandf.co/4vGuPvZ?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
آقا این VeloxDB عجب شاهکاریه! دیتابیس منیجر نوشته شده با Rust. دیگه از شر pgAdmin راحت میشید، خیلی سریعه. MySQL و SQLite رو هم اکسپریمنتال ساپورت میکنه
https://github.com/veloxbase/veloxdb
<Kyrovert />
884
🔵 عنوان مقاله
datapitfalls (GitHub Repo)
🟢 خلاصه مقاله:
در دنیای تحلیل داده، اطمینان از صحت و جامعیت دادهها اهمیت بسیار زیادی دارد. ابزارهای مبتنی بر هوش مصنوعی میتوانند نقش مهمی در شناسایی خطاها و اشکالات موجود در فرآیندهای تحلیل ایفا کنند. یکی از این ابزارهای مفید و قابل اعتماد، پروژه متنباز «datapitfalls» است که بر پایه فناوری کلود (Claude) ساخته شده است. این ابزار به طور ویژه برای ارزیابی و بررسی نمودارها، کدهای برنامهنویسی، تحلیلهای مکتوب و اسناد مختلف طراحی شده است تا خطاهای رایج در دادهها را شناسایی کند و از وقوع آنها جلوگیری کند.
این ابزار فراتر از بررسی صرف نمودارها و خطاهای گرافیکی معمول عمل میکند. «datapitfalls» از طبقهبندی «حذر از مشکلات داده» اثر بن جونز (Ben Jones) بهرهمند است تا بتواند مشکلاتی مانند تعصب در دادهها، شکستهای پنهان در فرآیندهای پایپلاین، تجمیع نادرست دادهها، خطاهای آماری، تصاویر گیجکننده و ارائه نادرست مطالب را شناسایی کند. پس از کشف این موارد، ابزار میزان اهمیت و شدت هر مشکل را مشخص میکند و در کنار آن، راهکارهای پیشنهادی برای رفع آنها را ارائه میدهد.
این رویکرد جامع و دقیق به تحلیل دادهها کمک میکند تا تحلیلگران بتوانند خطاهای پنهان را قبل از نهایی کردن نتیجه شناسایی و رفع کنند، و در نتیجه دقت و اعتمادپذیری تحلیلهای خود را افزایش دهند. «datapitfalls» با تکیه بر استانداردهای معتبر و طبقهبندیهای مرسوم، ابزاری ارزشمند در فرآیندهای تحلیل داده و تضمین کیفیت است.
#تحلیل_داده #ابزار_باز #کیفیت_داده #هوش_مصنوعی
🟣لینک مقاله:
https://github.com/bjonesdataliteracy/datapitfalls?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
دیتای متروی تهران (Tehran Metro Data) چیه؟
دسترسی به یک دیتابیس دقیق، ساختاریافته و آماده از خطوط و ایستگاههای متروی تهران، همیشه یکی از دغدغههای برنامهنویسها و توسعهدهندهها بوده. برای همین ما ریپازیتوری «Tehran Metro Data» رو منتشر کردیم.
این پروژه یک دیتاست استاندارد از شبکه متروی تهران هست؛ یعنی شما رو از جستجوی پراکنده، جمعآوری دستی یا اسکرپ کردن اطلاعات برای پروژههاتون کاملاً بینیاز میکنه.
این دیتا بدون نیاز به هیچ پیشپردازشی، مستقیماً برای ساخت اپلیکیشنهای مسیریابی، باتها یا تحلیل داده قابل استفاده است. مهمتر از همه اینکه اطلاعات به شکلی مرتب شده که بهراحتی و بدون دردسر Data Cleaning، توی کد ایمپورت بشه.
https://github.com/mostafa-kheibary/tehran-metro-data
<تهلاگ/>
884
Repost from N/a
♨️ واکنش پاول دوروف به محدودیت اینترنت؛ پای ایران هم وسط کشیده شد! 🇮🇷🤔
🇬🇧 طبق گزارشات ظاهراً دولت بریتانیا قراره دسترسی افراد زیر ۱۶ سال به شبکههای اجتماعی رو محدود کنه 🚫📱، اما پاول دوروف معتقده این کار فقط نوجوانهارو به سمت VPN هل میده 🕵️♂️🌐.
▪️بنیانگذار تلگرام برای مثال از ایران و روسیه نام برده و گفته محدودیتها باعث نمیشه کاربران شبکههای اجتماعی رو ترک کنن ؛ فقط روش دسترسیشون عوض میشه 🔄📶.
⚠️ طبق قانون جدید، کاربران بریتانیایی باید برای اثبات سن خود مدارکی مثل کارت شناسایی 🆔، کارت بانکی 💳 یا اسکن چهره ارائه کنن 📸.
.
https://t.me/+Bp8JeTpQoiUwMjVk
884
🔵 عنوان مقاله
DeltaX (δx): Fast Time-Series Extension for Postgres
🟢 خلاصه مقاله:
دلتای ایکس (δx) یک افزونه سریع و کارآمد برای مدیریت دادههای زمانی در پایگاه دادههای پستگرس است که توسط شرکت زاتا توسعه یافته است. این افزونه به شکل یک افزونه ستونی برای ذخیرهسازی دادههای سری زمانی طراحی شده؛ اما برخلاف دیگر راهکارهای مشابه، از جداول عادی پستگرس استفاده میکند. این ویژگی به این معناست که عملیات معمولی مانند تکرار، بازیابی در صورت سقوط سیستم، تهیه نسخه پشتیبان و استفاده از ابزارهایی مانند pg_dump همچنان به همان شیوه و سادگی معمول اجرا میشوند، زیرا از همان ساختارهای استاندارد پایگاه داده بهره میبرد.
با استفاده از این افزونه، مدیریت و تحلیل دادههای زمانی در پایگاههای داده پستگرس بسیار سادهتر و سریعتر انجام میشود. این فناوری نوآورانه، امکانات قدرتمندی را در اختیار کاربران قرار میدهد تا دادههای سری زمانی خود را بهگونهای منسجم و کارآمد نگهداری کرده و به راحتی آنها را پردازش و بررسی کنند. این رویکرد جدید، بهرهوری و قابلیت اطمینان سیستمهای مبتنی بر پایگاه دادههای پستگرس را به شکل قابل توجهی افزایش میدهد و تمامی عملیات روزمره را با همان سهولت و امنیت قبلی انجام میدهد.
در نهایت، DeltaX (δx) راهحلی سریع، مقاوم و سازگار با اکوسیستم پستگرس است که توانایی اداره دادههای زمانی حجیم را با کمترین دغدغه فراهم میکند. این فناوری، فرصت جدیدی را برای توسعهدهندگان و تحلیلگران داده فراهم میسازد تا بدون نگرانی در مورد سازگاری، تمرکز خود را بر تحلیل و بهرهبرداری عملیاتی از دادهها معطوف کنند.
#پایگاه_داده #دیتا_سری_زمانی #پستگرس #توسعه
🟣لینک مقاله:
https://github.com/xataio/deltax
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
PostgreSQL 19 Beta 1 Released
🟢 خلاصه مقاله:
نسخه آزمایشی PostgreSQL 19 Beta 1 منتشر شد. یکی از مهمترین و هیجانانگیزترین نسخههای این سیستم مدیریت پایگاه داده، با امکانات جدیدی که توسعهدهندگان و کاربران را به صورت قابل توجهی حمایت میکند، معرفی شده است. این نسخه، گامی مهم در جهت بهبود عملکرد و امکانات PostgreSQL است که شامل قابلیتهای متنوع و کاربری است.
از جمله ویژگیهای مهم این بهروزرسانی میتوان به افزودن قابلیت کوئریهای گراف، افزایش سرعت در عملیات وارد کردن دادهها، و بهبود در ابزارهای مشاوره و برنامهریزی برای اجرای درست کوئریها اشاره کرد. همچنین، سیستم جدید اتواوکسیکوم (autovacuum) با قابلیتهای چندنخگرا و توانایی استخراج و پاکسازی دادهها به صورت موازی، کارایی و بهینگی پایگاه داده را به سطح جدیدی رسانده است. کاربران اکنون میتوانند صحت دادهها را در لحظه و بدون نیاز به توقف سیستم، با فعالسازی آنلاین چکسامها کنترل کنند.
نسخه آزمایشی در دسترس است و کاربران میتوانند در حال حاضر آن را آزمایش و بازخوردهای خود را ارائه دهند. نسخه نهایی این نسخه در حدود اواخر سپتامبر یا اوایل اکتبر منتشر خواهد شد، که وعدهای هیجانانگیز برای جامعه پایگاه دادهها است.
این پیشرفتها نشان میدهد که PostgreSQL در مسیر توسعه قویتر و کاربرپسندتر قرار دارد و باید انتظار داشت کارایی و امنیت آن در آینده نزدیک به سطح بالاتری برسد.
#PostgreSQL #نسخهآزمایشی #پایگاهداده #توسعهپایگاهداده
🟣لینک مقاله:
https://www.postgresql.org/about/news/postgresql-19-beta-1-released-3313/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
ingestr v1: Copy Data to and from Databases in One Command
🟢 خلاصه مقاله:
در عصر دادهمحور امروز، نیاز به ابزارهای ساده و کارآمد برای انتقال اطلاعات بین پایگاههای داده مختلف بسیار احساس میشود. ingestr v1 یکی از این ابزارهای پیشرفته است که بر پایه زبان برنامهنویسی Go توسعه یافته است و امکان کپی کردن دادهها را میان منابع و مقاصد متعدد، بدون نیاز به نوشتن کد، فراهم میکند. این ابزار ضمن پشتیبانی از انتقال دادهها به صورت افزایشی و ادغام، روند انتقال اطلاعات را بسیار ساده و سریع میکند، به گونهای که میتوان به راحتی دادهها را از پایگاههای مختلف مانند Postgres و دیگر منابع به مقصد مورد نظر منتقل کرد.
این ابزار، با طراحی کاربرپسند و قابلیتهای قدرتمند، به شما اجازه میدهد تنها با یک دستور، دادههای مورد نیازتان را بین سیستمها جابجا کنید. افزون بر این، قابلیتهای پیشرفتهای نظیر ادغام دادهها و پشتیبانی از نوع های مختلف منابع، آن را به ابزاری ایدئال برای بهرهوری در پروژههای دادهمحور تبدیل کرده است. در نتیجه، ingestr v1 بدون نیاز به برنامهنویسی و با کمترین تلاش، فرآیند انتقال اطلاعات را برای کاربران بسیار تسهیل میکند.
در پایان، این ابزار پتانسیل زیادی برای سازمانها و تیمهای فناوری اطلاعات دارد که میخواهند انتقال دادههای سریع، امن و انعطافپذیر را در پروژههای خود تضمین کنند. اگر به دنبال راهحلی ساده اما قدرتمند برای جابجایی دادهها هستید، ingestr v1 گزینهای است که نباید از دست بدهید.
#ابزارهای_داده #انتقال_داده #پایگاهداده #توسعه_فناوری
🟣لینک مقاله:
https://github.com/bruin-data/ingestr
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Postgres is the Gateway Drug
🟢 خلاصه مقاله:
پستگرس (PostgreSQL) تبدیل به دروازهای جذاب و کمنظیر در دنیای پایگاههای داده شده است. در واقع، این سیستم مدیریت پایگاه داده متنباز و قدرتمند، توجه شرکتهای بزرگی را به خود جلب کرده است، به طوری که طی هجده ماه گذشته، بیش از ۳ شرکت بزرگ در زمینههای مختلف برای توسعه و بهبود فناوریهای مرتبط با پستگرس، بیش از یک میلیارد و پانصد میلیون دلار سرمایهگذاری و یا در فرآیند خرید و ادغام انجام دادهاند. این روند نشاندهنده اهمیت و استقبال روزافزون از پستگرس به عنوان پایهای برای توسعه پروژههای نوآورانه در حوزه فناوری است.
پروژههای مربوط به پستگرس نه تنها در بازارهای فناوری اطلاعات، بلکه در صنایع مختلف از جمله بانکداری، سلامت و فناوریهای ابری رشد قابل توجهی داشتهاند، چرا که این پایگاه داده متنباز قابلیتهای منعطف و مقیاسپذیری بالایی را ارائه میدهد که نیازهای کسبوکارهای بزرگ و در حال توسعه را برآورده میکند. این محبوبیت و تقاضا، شرکتها را به سمت سرمایهگذاری گستردهتر و تمرکز بر فناوریهای مرتبط با پستگرس سوق داده است، زیرا آنها میدانند که آینده دنیای فناوری در استفاده از سیستمهای متنباز و انعطافپذیر مانند پستگرس نهفته است.
در نتیجه، میتوان گفت که پستگرس نه تنها یک پایگاه داده است، بلکه به عنوان یک دروازه برای شرکتها به دنیای فناوری نوآورانه و فرصتهای جدید عمل میکند. این روند نشاندهنده علاقه عمیق و چشمانداز روشن آینده فناوریهای متنباز است که با رشد سرمایهگذاریها و ادغامهای بزرگ، اهمیت آن بیش از پیش شناخته میشود.
#پستگرس #پایگاهداده #فناوری_متن_باز #سرمایه_گذاری
🟣لینک مقاله:
https://postgresweekly.com/link/182391/web
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
online toggling of data checksums
🟢 خلاصه مقاله:
در این روزها، امکانات متعددی برای کنترل و صحتسنجی دادهها به صورت آنلاین ارائه شده است که کاربران میتوانند هماکنون آزمایش و استفاده کنند. این ابزارها به طور ویژه برای تضمین سلامت و صحت اطلاعات طراحی شدهاند و کاربر نهایی میتواند بدون نیاز به نصب نرمافزارهای پیچیده، عملیات بررسی دادهها را انجام دهد. انتظار میرود نسخه نهایی این ابزارها در حدود اواخر شهریور یا اوایل مهر ماه منتشر شود. این تحولات نشاندهنده پیشرفتهای چشمگیر در حوزه فناوری اطلاعات است که فرآیندهای بررسی و کنترل دادهها را سریعتر و مطمئنتر میسازد، و قطعاً تاثیر زیادی بر بهرهوری و دقت در کارهای مرتبط خواهد داشت.
در نهایت، این امکانات جدید، فرصتهای زیادی برای توسعهدهندگان و کاربرانی که به امنیت دادهها اهمیت میدهند، فراهم میآورد. با نزدیک شدن به تاریخ عرضه نهایی، میتوان انتظار داشت که استقبال گستردهتری از این ابزارها صورت گیرد و کاربرها بتوانند به سادگی و با اطمینان بیشتری از صحت دادههای خود مطمئن شوند.
پیشنهاد میشود علاقمندان پیگیر اطلاعیههای رسمی باشند تا زمان دقیق انتشار نسخه نهایی و امکانات نهایی آنها را دریافت کنند و بهرهبرداری بهتری داشته باشند.
#اطلاعات_آنلاین #تکنولوژی #کنترل_داده #امنیت_اطلاعات
🟣لینک مقاله:
https://www.postgresql.org/docs/19/checksums.html#CHECKSUMS-ONLINE-ENABLE-DISABLE
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
Repost from N/a
دنیای تکنولوژی در شنبه ۲۳ خرداد؛ مهمترین خبرها
🔒 شورای هماهنگی بانکها حمله سایبری به چهار بانک بزرگ کشور را تأیید کرد؛ خدمات الکترونیک بانکهای ملی، تجارت، صادرات و توسعه صادرات دچار اختلال گسترده شد. تیمهای فنی اعلام کردند هیچ نشت اطلاعاتی رخ نداده و عملیات ایمنسازی در حال انجام است.
🚀 اسپیسایکس در نخستین روز بورسی خود در نزدک ۲۳ درصد جهش کرد و ارزش شرکت به ۱.۷۷ تریلیون دلار رسید. این عرضه اولیه تاریخی، شرکت ایلان ماسک را به ششمین موجودیت ارزشمند آمریکا تبدیل کرد.
🤖 دولت آمریکا دسترسی کاربران غیرآمریکایی به مدلهای پیشرفته انتروپیک را مسدود کرد؛ اندری کارپاتی، دانشمند ارشد این شرکت، به دلیل نداشتن تابعیت آمریکا از استفاده از همین مدلها منع شد. انتروپیک این محدودیت را حاصل سوءتفاهم میداند و در حال اعتراض است.
💰 سرمایهگذاری ۹۰۰ میلیون دلاری گوگل در اسپیسایکس اکنون ۱۰۰ میلیارد دلار ارزش دارد. این بازدهی ۱۱۰ برابری، آن را به یکی از سودآورترین سرمایهگذاریهای تاریخ فناوری تبدیل کرده است.
📱 اوپنایآی با همکاری جانی آیو در پی ساخت گوشی هوشمندی است که اپلیکیشنهای سنتی را با موبایلهای مبتنی بر ایجنت جایگزین کند. این پروژه میتواند مانند سقوط نوکیا و بلکبری، بازار موبایل را دگرگون سازد.
🌌 پژوهشگران با شبیهسازی ابررایانهها احتمال میدهند منظومه شمسی میزبان سیاره غولپیکر پنجمی بوده که از مدار بیرون رانده شده است. این فرضیه بر پایه مدل نیس، تاریخچه شکلگیری سیارات را بازنگری میکند.
☄️ برخورد سیارک چیکشلوب ۶۶ میلیون سال پیش، محل برخورد در مکزیک را تا ۸ میلیون سال گرم نگه داشت. این گرمای زیرزمینی به پناهگاهی برای حیات میکروسکوپی تبدیل شد و نشان میدهد برخوردهای عظیم میتوانند بستری برای شکلگیری حیات باشند.
⚛️ دانشمندان برای نخستین بار ساعت هستهای ساختند؛ این فناوری بر گذارهای انرژی هسته اتم استوار است و دقت بسیار بالاتری نسبت به ساعتهای اتمی فعلی دارد. همچنین امکان ساخت زمانسنجهای کوچکتر و قابلحمل را فراهم میکند.
🍄 شبکههای قارچی زیر خاک طولی معادل ۱۱۰ کوادریلیون کیلومتر دارند؛ پژوهشی در Science نشان میدهد این ساختارها ۷۵۰ میلیون برابر فاصله زمین تا خورشید گسترده شدهاند و نقش حیاتی در تعادل اقلیمی دارند.
🌿 راز سرعت خیرهکننده ونوس مگسخوار پس از ۲۰ سال تحقیق فاش شد؛ حرکت سریع این گیاه نتیجه تغییر ویژگیهای مکانیکی سلولهاست و نه صرفاً جابهجایی مایعات. این یافته در ژورنال Science منتشر شده است.
🏎 بیامو با کانسپت Neue Klasse M، عصر جدید خودروهای اسپرت برقی را آغاز کرد. مدل M3 جدید با چهار موتور برقی و قدرتی حدود هزار اسببخار، از بهار آینده وارد خط تولید میشود.
🎮 بازی GTA 5 به سرویس اشتراکی +GTA پیوست؛ کاربران این سرویس ماهانه هشت دلاری اکنون به بخش تکنفره دسترسی دارند. این اقدام درست پیش از عرضه GTA 6 در ۲۸ آبان انجام میشود.
🌍 مدلهای اقلیمی هشدار میدهند جنگ هستهای محدود در مناطق گرمسیری، آسیبهای شدیدتری به لایه اوزون میزند. این تخریب ساختار محافظتی جو را مختل کرده و پیامدهای جهانی خطرناکی به دنبال دارد.
🔋 بنیانگذار انکر پیشبینی کرد پاوربانکها طی چند سال آینده مانند پخشکنندههای MP3 منسوخ شوند. این اظهارنظر در حالی مطرح میشود که انکر در سال ۲۰۲۴ حدود ۱۰۰ مدل مختلف پاوربانک عرضه کرده بود.
📱 سامسونگ گلکسی A27 5G را با تعهد آپدیت تا سال ۲۰۳۲ رونمایی کرد. این میانرده با نمایشگر ۶.۷ اینچی OLED و تراشه Snapdragon 6 Gen 3، برای استفاده طولانیمدت طراحی شده است.
🚗 جیران موتور دومین مرحله فروش خود را با قیمت قطعی آغاز کرد؛ در این طرح ۶ مدل GAC در ۱۱ تیپ با موعد تحویل ۹۰ روزه عرضه میشود و امکو هیبرید نخستین محصول انرژی نو در سبد فروش این شرکت است.
📈 بازگشت نسبی اینترنت، ترافیک مرسولات تجارت الکترونیک را ۳۴ درصد افزایش داد. مدیرعامل شرکت ملی پست اعلام کرد روزانه حدود ۱۰۰ هزار مرسوله بیشتر در شبکه پستی جابهجا شده است.
…
— تحریریه زومیت
👇👇👇👇
https://t.me/+Bp8JeTpQoiUwMjVk
