Database
Open in Telegram
🕸 Database Academy حمایت مالی: https://www.coffeete.ir/mrbardia72 ادمین: @mrbardia72
Show more884
Subscribers
No data24 hours
+17 days
+3630 days
Posts Archive
884
🔵 عنوان مقاله
Zero-sum by design: 10 years of Uber's payments platform (8 minute read)
🟢 خلاصه مقاله:
در دهه اخیر، پلتفرم پرداختهای اوبر، Gulfstream، به عنوان یکی از مهمترین و پرکاربردترین زیرساختهای مالی این شرکت تبدیل شده است. این سیستم در حال حاضر توانایی پشتیبانی از بیش از ۲۱۷ میلیارد دلار در معاملات ناخالص سالانه را دارد که تقریباً دو برابر ارزش جابجاییهای مالی در خود پلتفرم است. این رقم نشاندهنده کاربرد گسترده و اهمیت فوقالعاده سیستم در عملیاتهای روزمره اوبر است. علاوه بر این، با بهرهگیری از فناوریهای پیشرفته، مجموعهای از تعادلهای حسابررسی برای بیش از ۱.۲ میلیارد حساب فعال در پلتفرم مدیریت میشود، که نیاز به دقت و امنیت بالا در ثبت و جابجایی مالی دارد.
در طراحی این سیستم، از سفارشات مالی با ذات ثابت و بدون تغییر، بهرهبرداری میشود که بر اساس مفهوم حسابداری دوطرفه ساخته شده است. این رویکرد اطمینان میدهد که هر تراکنش، به صورت کاملاً شفاف و قابل رهگیری ثبت میشود و در صورت نیاز، میتوان تاریخچه کامل تمامی جابجاییها را بررسی کرد. همچنین، دادهها در بانک اطلاعاتی DynamoDB نگهداری میشوند که امکان دسترسی سریع و مقیاسپذیری بالا را فراهم میکند.
برای انتقال دادهها و مدیریت فرآیندهای در لحظه، از فناوری Kafka بهره گرفته شده است که جریانهای دادهای را به صورت پیوسته و کارا مدیریت میکند. سیستم Cadence نیز نقش مهمی در تنظیم فرآیندهای همزمان و هماهنگ ایفا میکند، که در عملیاتهایی مانند تایید تراکنش و هماهنگی اطلاعات، موثر است. در کنار این موارد، این پلتفرم از رابطهای عمومی و چندمنظوره برای ابزارهای پرداخت بهره میبرد؛ این امر اجازه میدهد خطوط جدید کسبوکار به سرعت و با کمترین تغییرات در هسته سیستم راهاندازی شوند، و انعطافپذیری بالایی در توسعه و انطباق با نیازهای آینده فراهم گردد.
در مجموع، اوبر با طراحی منحصربهفرد و استفاده از فناوریهای نوین، بستر مطمئنی برای انجام تراکنشهای مالی گسترده و قابل اطمینان ساخته است که توانسته بخش عمدهای از نیازهای مالی خود را به شکلی امن و مؤثر برآورده سازد.
#پرداخت #فناوری #تراکنش_مالی #اوبر
🟣لینک مقاله:
https://www.uber.com/us/en/blog/ubers-payments-platform/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
(Re)Building a FAQ System for DataTalks.Club (12 minute read)
🟢 خلاصه مقاله:
در دنیای امروز، پاسخگویی سریع و دقیق به سوالات کاربران اهمیت زیادی دارد، به همین دلیل شرکت DataTalks.Club تصمیم گرفت سیستم پرسش و پاسخ خود را مجدداً بازطراحی کند. در این پروژه، تیم توسعه بر ساخت یک ربات FAQ مبتنی بر منابع متنوع تمرکز کرد. این منابع شامل مشکلات و دستورالعملهای مختص به پروژه در GitHub، بحثهای موجود در Slack، و واژگان و گفتگویهای ضبط شده در ویدئوهای YouTube بودند. هدف از این کار ایجاد یک پایگاه داده غنی و قابل اعتماد بود که بتواند پاسخهای صحیح و بهموقع را در اختیار کاربران قرار دهد.
در این فرآیند، تیم تلاش کرد تا طراحی سیستم به گونهای باشد که بدون نیاز به ساخت سرورهای مستقل، به راحتی در محیطهای Serverless مانند AWS Lambda اجرا شود. این رویکرد نه تنها هزینهها را کاهش میدهد بلکه نگهداری و توسعه را نیز سادهتر میکند. با این حال، برای اطمینان از کیفیت پاسخها، توجه خاصی به برچسبگذاری مناسب، مدیریت دستههای بررسی، و مکاشفههای هزینهبر مربوط به صحت پاسخها در نظر گرفته شد. به ویژه، بررسی دقیق مواردی که ممکن است منجر به رد نادرست یا بسته شدن زودهنگام گفتگوها شوند، اهمیت زیادی داشت.
در نتیجه، این پروژه یادآوری مهمی است که کیفیت سیستمهای پاسخگویی مبتنی بر اطلاعات باید از همان ابتدا با نگهداری منظم و دقیق دادهها تضمین شود. اگر دادهها خام و ناپایدار باشند، حتی بهترین الگوریتمها هم نمیتوانند جوابهای مفید و مطمئن ارائه دهند. بنابراین، تمرکز بر مدیریت و بروزرسانی مداوم منبع دادهها، کلید موفقیت در توسعه سیستمهای یادگیری و بازیابی اطلاعات است.
#هوش_مصنوعی #سیستمهای_پاسخگو #یادگیری_ماشین #توسعه_پایگاه_داده
🟣لینک مقاله:
https://alexeyondata.substack.com/p/rebuilding-a-faq-system-for-datatalksclub?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Semi-Structured Data in Apache Iceberg: Meet the Variant Type (3 minute read)
🟢 خلاصه مقاله:
در نسخه سوم Apache Iceberg، نوع جدیدی به نام «نوع متغیر» یا «Variant» معرفی شد که برای مدیریت دادههای نیمهساختاری طراحی شده است. این نوع به کاربران اجازه میدهد رکوردهای شبیه به JSON، که ممکن است به سرعت تغییر کنند، در یک ستون واحد ذخیره شوند و در عین حال نوعهای اصلی مانند تایماستمپها، اعداد اعشاری، و مقادیر باینری حفظ شوند.
این نوع مبتنی بر کدگذاری باینری پارکت است و با اکثر سیستمهای پردازش داده مانند Spark و Flink سازگار است. از طریق SQL در Spark، میتوانید به راحتی این نوع دادهها را با تابع variant_get فراخوانی و مورد استفاده قرار دهید. این قابلیت، انعطافپذیری و کارایی در مدیریت دادههای نیمهساختاری را به جداسازی و تحلیل دادهها بیشتر کرده است.
در نتیجه، معرفی نوع «متغیر» در Iceberg، راهکاری مدرن و عملی برای کار با دادههای ناهمگون و دینامیک است که هم سازگاری با ابزارهای محبوب را فراهم میکند و هم امکان استخراج و تحلیل دادههای پیچیدهتر را برای توسعهدهندگان و تحلیلگران داده آسانتر میسازد.
#داده_نیمهساختاری #ApacheIceberg #پایگاه_داده #تحلیل_داده
🟣لینک مقاله:
https://iceberg.apache.org/blog/variant-in-apache-iceberg/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
وقتی جدول دیتابیس میلیاردها سطر داره، چطور فقط همون تکهای رو بخونیم که به کارمون میاد؟
دیتابیس که بزرگ میشه، فقط ایندکس کافی نیست. گاهی باید خودِ جدول رو تکهتکه کنیم تا موتور بتونه بخشهای نامربوط رو کلاً نادیده بگیره. به این میگن پارتیشنبندی.
توی این صفحه، چهار روش اصلی پارتیشنبندی RANGE، LIST، HASH و KEY رو بررسی کردم و تفاوت Partitioning با Sharding رو توضیح دادم.
همچنین با یک مثال، الگوی Sliding Window رو بررسی کردم که چطور میشه بدون انجام DELETE های سنگین، دادههای قدیمی رو آرشیو کرد. در نهایت هم تفاوت پیادهسازی این مفاهیم در SQL Server و MySQL رو بررسی کردم.
اگه براتون مفید بود، خوشحال میشم یه ستاره بهش بدین.
https://alireza-haeri.github.io/BackendDeepDives/DataPartitioning.html
@| <AliReza Haeri/>
884
چند روز پیش ی پست گذاشتم راجع به DuckDB و اینکه میشه دیتای با حجم چند ۱۰ گیگ را راحت روی یک لپتاپ لود کرد و استفاده کرد. الان نیاز داشتم چندین گیگابایت دیگه هم بهش دیتا اضافه کنم. کل تعداد رکوردها رسید ۲۷۰,۱۶۰,۰۱۱ میلیون رکورد. و فایل دیتابیس شد ۱۴.۵ گیگ. ولی سرعت همچنان فوق العاده بالاست. دموی پایین:
ارزونترین پلن Snowflake ماهی حدود ۱۰۰۰ دلار بود. خلاصه اینکه از این DuckDB و حتا sqlite (بسته به کاربردی که نیاز دارید) غافل نشید.
@
884
Repost from Job
💼 به دنبال استخدام برنامهنویس هستید؟ یا به دنبال فرصت شغلی مناسب میگردید؟
🟢 کارفرمایان:
اگر به دنبال جذب برنامهنویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود.
🟢 کارجویان:
اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکتها و کارفرمایان معرفی شوید. 🚀
👤 ادمین:
@mrbardia72
📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید:
✅ نام و نام خانوادگی (اجباری)
✅ سابقه کار (اجباری)
✅ محل سکونت (اجباری)
✅ امکان نقل مکان برای کار (اجباری)
🔹 لینک LinkedIn (اختیاری)
🔹 لینک GitHub (اختیاری)
884
🔵 عنوان مقاله
Spark Tips. Partition Tuning (12 minute read)
🟢 خلاصه مقاله:
در تنظیم اندازه بخشهای اسپارک، هدف اصلی بهینهسازی بهرهوری و پایداری سیستم است. باید تلاش کنیم تعداد بخشها به قدری باشد که بتوانیم از تمام هستههای موجود بهرهبرداری کنیم، بدون اینکه وظایف بسیار کوچک ایجاد کنیم که زمان پردازش را افزایش میدهد. بهتر است عملیات فیلتر را در مراحل اولیه انجام دهیم تا حجم دادههایی که باید منتقل و پردازش شوند کاهش یابد. همچنین، نباید بر دادههای غیرضروری shuffle انجام دهیم و در مواقعی که ساختار فعلی دادهها مناسب نیست، مجدداً بخشبندی دادهها را برای بهتر شدن عملیاتهای join یا نوشتن انجام دهیم.
در راهنمای عملی، نکاتی مانند قابلیت خودکار بهینهسازی کیفیت اطلاعات (AQE)، مشکلات ناشی از توزیع نابرابر دادهها (Skew)، مشکلات مربوط به spilling و استفاده از نقاط کنترل (checkpoint barriers) مورد بحث قرار میگیرند. علاوه بر این، توازن میان فایلهای کوچک و بزرگ نیز اهمیت دارد و نیاز است تا با توجه به نوع دادهها و عملیات، تنظیمات بهینه را اعمال کنیم. رعایت این موارد به بهبود عملکرد و کاهش مشکلات سیستم کمک میکند و به ما اجازه میدهد تا منابع را بهتر مدیریت کنیم.
#اسپارک #بهینهسازی #پایداریداده #توزیع دادهها
🟣لینک مقاله:
https://luminousmen.substack.com/p/spark-tips-partition-tuning?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
We will ship the first Polars 2.0 release candidate next week (1 minute read)
🟢 خلاصه مقاله:
ما هفته آینده اولین نسخه آزمایشی رسمی از نرمافزار Polars 2.0 را منتشر خواهیم کرد. این نسخه که به عنوان "کاندیدا" شناخته میشود، مرحلهای مهم در فرآیند توسعه است، زیرا نشانگر آمادگی این نسخه برای عرضه نهایی است و فرصت خوبی است برای کاربران و توسعهدهندگان تا بازخوردهای خود را ارائه دهند و مشکلات احتمالی را شناسایی کنند.
نسخه 2.0 از Polars در حال حاضر در مراحل نهایی قرار دارد و تیم توسعه کاملاً بر روی اصلاح نقاط ضعف و بهبود عملکرد آن تمرکز کرده است. این نسخه شامل ویژگیهای جدید و بهبودهای قابل توجهی است که هدفشان بهبود کارایی و سهولت استفاده است. انتظار میرود با انتشار این نسخه، کاربران تجربه کاربری بهتر و ابزارهای قدرتمندتری در اختیار داشته باشند، که این امر میتواند تاثیر قابل توجهی در پروژههای دادهکاوی و آنالیزهای حجیم داشته باشد.
با نزدیک شدن به تاریخ انتشار، تیم توسعه فعالانه در حال جمعآوری بازخوردها و رفع خطاهای احتمالی است تا نسخه نهایی با بهترین کیفیت ممکن ارائه شود. این مرحله اهمیت ویژهای دارد، چرا که نتیجه نهایی باید تمام نیازها و انتظارات کاربران را برآورده کند و تجربه کاری رضایتبخش را فراهم آورد.
پیشبینی میشود با عرضه نسخه آزمایشی، جامعه کاربری و توسعهدهندگان به همکاری بیشتر تشویق شوند و نظرات ارزشمندی درباره نهاییسازی ویژگیها ارائه دهند. این تعامل مستقیم کمک میکند تا Polars 2.0 نه تنها یک بهروزرسانی کوچک بلکه یک تغییر اساسی در امکانات و کارایی باشد.
منتظر باشید، چرا که هفته آینده با انتشار این نسخه آزمایشی، تحولات جدید در انتظار شماست و بهبودهای چشمگیر در انتظار پروژههای دادهکاوی شما قرار دارد.
#پولارس #نسخه۲٫۰ #دادهکاوی #توسعه
🟣لینک مقاله:
https://threadreaderapp.com/thread/2089338347286093851.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Postgres 19: How Our Advice Has Changed Since We Wrote It (16 minute read)
🟢 خلاصه مقاله:
در نسخهی جدید پستگرس ۱۹، تغییرات عمدهای صورت نگرفته است، بلکه بیشتر بر تقویت روشهای اثباتشده گذشته تمرکز شده است. این نسخه با توسعه فناوری I/O غیرهمزمان و افزودن قابلیتهای خودکار در مقیاسپذیری، عملکرد سیستمهای پایگاه داده را بهبود میبخشد. علاوهبر این، امکاناتی مانند نسخهپذیری قویتر عملیات COPY، استفاده پیشفرض از فشردهسازی LZ4، بهبود در سیستمهای ایندکسگذاری و مدیریت راحتتر بخشبندیها، از جمله ویژگیهای برجسته آن هستند. نکات کلیدی در طراحی و نگهداری پایگاه داده هنوز هم همان اصول اولیه باقیمانده است: بهرهگیری از دستور COPY برای بارگذاری دادههای انبوه، مدلسازی دادههای پرترافیک به صورت ساختاری، انتخاب هوشمندانه ایندکسها و استفاده از بخشبندی بیشتر برای مدیریت چرخه عمر دادهها. این تحولات، کمک میکنند تا توسعهدهندگان و مدیران پایگاه داده بتوانند بهتر و کارآمدتر روی پروژههای خود کار کنند، بدون اینکه نیاز به تغییر بنیادین در استراتژیهای خود باشد.
#پستگرس #پایگاه_داده #مدیریت_داده #توسعه_نرمافزار
🟣لینک مقاله:
https://www.crunchydata.com/blog/postgres-19-how-our-advice-has-changed-since-we-wrote-it?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
I spent 10 hours vibe-coding a tool to visualize any Parquet file's internals (2 minute read)
🟢 خلاصه مقاله:
در دوی ساعت گذشته، من به مدت ۱۰ ساعت صرف برنامهنویسی و توسعه ابزاری در مرورگر کردم که قادر است ساختار داخلی هر فایل پارکت را به وضوح نشان دهد. این ابزار کوچک با استفاده از زبان برنامهنویسی Rust و کتابخانهی arrow-rs طراحی شده است و وظیفه آن تحلیل و نمایش جزئیات فایلهای پارکت است که معمولاً پنهان میمانند.
این ابزار قادر است بخشهای مختلف فایل، مانند گروههای ردیفی، تکههای ستونها، صفحات، اسکیمها، کدگذاریها، فیلترهای بلوم، اندازهها، و آمار حداقل و حداکثر را به صورت گرافیکی و قابل فهم نمایش دهد. به این ترتیب، توسعهدهندگان، دانشاموزان و محققان میتوانند با استفاده از این ابزار، درک بهتری نسبت به جزئیات فایلهای ستونی پیدا کنند که نقش مهمی در بهبود فرآیندهای تحلیل داده و اشکالزدایی ایفا میکند.
این ابزار نه تنها برای آموزش مفید است بلکه در فرآیندهای اشکالزدایی و بهینهسازی فایلهای پارکت، کمک قابل توجهی میکند. در واقع، این پروژه نشان میدهد چطور میتوان با بهرهگیری از فناوریهای مدرن و زبانهای برنامهنویسی قدرتمند، ابزارهای کارآمدی ساخته و دانش فنی خود را توسعه داد.
#تحلیل_فایل_پارتک #برنامهنویسی #دیتا_فناوری #ابزارهای_دیجیتال
🟣لینک مقاله:
https://vutr.substack.com/p/i-spent-10-hours-vibe-coding-a-tool?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Simplifying data and product integrations with a data abstraction layer (8 minute read)
🟢 خلاصه مقاله:
در دنیای پرسرعت امروزی، یکپارچهسازی دادهها و محصولات یکی از چالشهای مهم شرکتها است. Uber توانسته است با بهرهگیری از یک لایه انتزاع داده (Data Abstraction Layer) راهحلی کارآمد و انعطافپذیر ارائه دهد که فرآیندهای مربوط به ادغام دادهها را بسیار سادهتر و سریعتر میکند. این فناوری، اتصال میان محصولات و دادههای مختلف را از قید و بند تغییرات در جداول فیزیکی، ساختارهای اطلاعاتی و زیرساختهای پشتیبانی آزاد میسازد و امکان توسعه و بهروزرسانی سریعتر سیستمها را فراهم میآورد.
در این روش، لایه انتزاع دادهها شامل جداول منطقی است که به صورت مجازی ایجاد شده و به کمک API خاص FetchData، قادر است درخواستهای متعدد را به طور همزمان و کارآمد از منابع مختلف مانند جداول لحظهای و روزانه، مخازن OLAP، دیتاستور، داکاستور و هایو پردازش کند. این ساختار، سوای اینکه نیاز به تغییرات مکرر در ساختارهای فیزیکی باشد، امکان جمعآوری و تحلیل دادههای متنوع را فراهم میآورد. به عنوان مثال، دادههای مربوط به گزارشگری تبلیغاتی، که پیشتر هفتهها زمان میبرد، اکنون در مدت زمان کمتر از دو روز قابل دستیابی است، که تاثیر قابل توجهی بر کارایی و سرعت تصمیمگیریهای استراتژیک دارد.
در مجموع، این رویکرد نه تنها فرآیندهای دادهای را تسهیل میکند، بلکه باعث افزایش دقت، کاهش خطاها و بهبود کارایی عملیاتی میشود. Uber با بهرهگیری از لایه انتزاع داده، آیندهای پر از نوآوری و پاسخگویی سریع به نیازهای بازار را ترسیم کرده است که میتواند الگوی موفقی برای دیگر شرکتها در حوزه فناوری و داده باشد.
#مدیریت_داده #یکپارچه_سازی_داده #تحلیل_در_زمان_واقعی #فناوری
🟣لینک مقاله:
https://www.uber.com/us/en/blog/data-abstraction-layer/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
We turned off Pub/Sub and nobody noticed (17 minute read)
🟢 خلاصه مقاله:
تیم Incident.io با هدف ارتقاء سطح اطمینانپذیری سیستمهای خود، تصمیم گرفتند سرویس Pub/Sub گوگل را غیرفعال کنند. این اقدام در حالی صورت گرفت که تمامی اعضای تیم و کاربران متوجه تغییر نشدند، چرا که این پروسه به گونهای طراحی شده بود که بدون توقف یا اختلال در کارکرد سیستم انجام شود.
برای رسیدن به این هدف، تیم اقدام به جایگزینی Pub/Sub با ناتس (NATS) كرد و سپس یک تعادلبار فعال-فعال (Active-Active Load Balancer) پیادهسازی کردند. این تعادلبار به صورت خودکار پیامها را بین هر دو سابسیستم توزیع میکرد، به گونهای که در صورت بروز هرگونه مشکل در یک بخش، دیگری به طور پیوسته وظیفه را بر عهده داشت و سیستم عملکرد بدون مشکل خود را حفظ میکرد.
در مراحل آزمایش، تیم تمام سرویس Pub/Sub را به طور کامل غیرفعال کرد و عملکرد سیستم را زیر نظر گرفت تا اطمینان حاصل کند که هیچ پیام از دست نمیرود و هیچ تأثیر منفی بر تجربه کاربری ندارد. نتایج این آزمایشها بسیار رضایتبخش بود؛ هیچ پیام گم نشده، خطای ناپیدا و هیچ پیامد منفی برای کاربران مشاهده نشد.
این راهکار نشان داد که با طراحی مناسب و استفاده از فناوریهای نوین، میتوان سیستمهای حساس و مهم را بدون توقف بهبود بخشید و از بروز علائم نقطه ضعف در زیرساختهای حیاتی جلوگیری کرد.
#پاسخگویی_پایدار #مدیریت_پرسنل #تسریع_توسعه #تکنولوژی_نواوری
🟣لینک مقاله:
https://incident.io/blog/we-turned-off-pub-sub-and-nobody-noticed?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Massively parallel Postgres backups (7 minute read)
🟢 خلاصه مقاله:
در دنیای مدیریت پایگاههای داده، بکاپگیری سریع و مطمئن همواره یکی از چالشهای مهم محسوب میشود. اخیراً، طراحی جدید PlanetScale برای بکاپگیری از پایگاه دادههای پستگرس به صورت همزمان و موازی تحولی بزرگ در این حوزه ایجاد کرده است. این سیستم، هر بخش (شارد) از پایگاه داده را به عنوان یک عامل مستقل در نظر میگیرد که وظیفه دارد نسخهی پشتیبان سالم، کامل و سریع را بازیابی کند. در واقع، هر شارد به عنوان یک نیروی مجزا عمل میکند که میتواند عملیات بازسازی، بازیابی از S3، تکرار WAL و تثبیت یک نقطهی زمانی معین را به صورت همزمان انجام دهد. این رویکرد باعث شده فرآیند بکاپگیری چندین برابر سریعتر و کارآمدتر باشد، تا جایی که زمان لازم برای تهیه یک نسخه کامل در عرض چند دقیقه کاهش یافته است.
این طراحی نوآورانه با بهرهگیری از مفهوم تقسیم وظایف، امکان انجام عملیاتهای همزمان را فراهم میآورد. هر شارد به صورت همزمان میتواند عملیات بازیابی، تکرار لاگ تراکنشهای WAL و تثبیت دادهها را انجام دهد، بدون اینکه تأثیر منفی بر روی سایر بخشها داشته باشد. نتیجه این است که تهیه نسخه پشتیبان کامل و سازگار، در کوتاهترین زمان ممکن انجام میشود، که این موضوع برای کسبوکارهای حساس به زمان و نیازمند بازیابی سریع بسیار حیاتی است. این رویکرد انقلابی در طراحیهای مرسوم، پتانسیل تغییر شیوهی مدیریت و نگهداری نسخههای پشتیبان را دارد و به مدیران دادهها امکان میدهد انعطافپذیری و ضریب اطمینان بیشتری در عملیاتهای بکاپگیری داشته باشند.
در کل، این فناوری، که به صورت موازی و همزمان عملیات بازیابی را انجام میدهد، نه تنها زمان مورد نیاز برای بکاپگیری را به شدت کاهش میدهد، بلکه سطح اطمینان و صحت دادهها را نیز افزایش میدهد. پیادهسازی چنین سیستمی به نقل قول، نشاندهندهی پیشرفتهای قابل توجه در حوزه فناوریهای مدیریت پایگاه داده است که میتواند تاثیرات بلندمدتی در بهرهوری و امنیت دادهها داشته باشد.
#پایگاه_داده #پستگرس #بکاپ_پیشنهاد_موازی #مدیریت_پایگاه
🟣لینک مقاله:
https://planetscale.com/blog/massively-parallel-postgres-backups?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Software engineering at a proprietary trading company: Optiver (17 minute read)
🟢 خلاصه مقاله:
شرکت نهادهای تجاری اختصاصی، مانند اوتیور، نمونهای بارز از نحوه تأثیر مستقیم فناوری بر سود و زیان در صنعت مالی است. سیستم این شرکت، نشاندهنده ارتباط مستقیم میان کاهش تأخیر، افزایش قابلیت اطمینان و کیفیت یادگیری ماشین با موفقیتهای مالی است. تیمهای فنی این شرکت، که حدود ۹۵۰ مهندس را شامل میشوند، روزانه بیش از ۱۰ میلیون معامله در بازارهای مختلف انجام میدهند. این عملیات گسترده روی زیرساختی متنوع صورت میگیرد که شامل زبانهای برنامهنویسی قدرتمندی مانند C++، Python، Rust، سیستمهای پیامرسان Kafka، پایگاه دادههای Postgres، پلتفرمهای پردازش داده مانند Databricks، هستههای لینوکس سفارشی و سختافزارهای مستقر در مکانهای مختلف است.
در این فضای فناوری، رویکرد اصلی بر مالکیت عمیق و کامل زیرساختها استوار است، نه تنها تمرکز بر سرعتگذاری سطحی. این فرهنگ باعث شده است که هر بخش، به صورت تخصصی و جامع در توسعه و نگهداری زیرساختهای مورد نیاز خود نقش داشته باشد. نتیجهاش سیستمهایی کارآمد و مقاوم است که توانایی پاسخگویی به نیازهای پیچیده معاملات مالی را دارند. در نتیجه، حافظههای فنی و فناوری این شرکت نشاندهنده تعهد به ساختارهای مستحکم و بهبود مستمر است که در نهایت سودآوری و پایداری کسبوکار را تضمین میکند.
#فناوری #هوش_مصنوعی #تجارت_رایانهای #زیرساخت
🟣لینک مقاله:
https://newsletter.pragmaticengineer.com/p/optiver?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
DFlash 2: Keep Drafting Parallel (10 minute read)
🟢 خلاصه مقاله:
در دفلش ۲، فرآیند رمزگشایی تئوری بسیار بهبود یافته است. این فناوری اجازه میدهد که فرآیند پیشبینی و رمزگشایی مدلهای زبانی بزرگ (LLM) بسیار سریعتر انجام شود، به طوری که تخمین زده میشود سرعت استنتاج آن حدود سه برابر افزایش یافته است. یکی از اصلیترین ویژگیهای این فناوری، توانایی پذیرش تعداد بیشتری توکن در هر بار پردازش است، در حالی که نتیجه نهایی و خروجی مدل دستنخورده باقی میماند. این یعنی زمان مورد نیاز برای تولید متن کاهش یافته است، بدون این که کیفیت یا دقت نتایج کاهش یابد یا تفاوتی در خروجی نهایی ایجاد شود.
این پیشرفت، به ویژه در کاربردهای عملی و اجرایی، کارایی و سرعت سیستمهای مبتنی بر هوش مصنوعی را به شدت ارتقاء میدهد. میتوان تصور کرد که در آینده، این فناوری امکان پاسخدهی سریعتر در چتباتها، ترجمههای فوری و دیگر برنامههای زبانی را فراهم کند و دقت و کارایی این سیستمها را به طور چشمگیری افزایش دهد. بنابراین، دفلش ۲ نه تنها یک بهبود فنی است، بلکه در راستای تسهیل و بهبود تجربه کاربری نهایی نقش مهمی ایفا میکند.
در نتیجه، توسعه این فناوری گامی مهم در مسیر بهبود سرعت و بهرهوری مدلهای زبانی بزرگ است و میتواند تاثیر زیادی بر توسعه کاربردهای هوشمند و افزایش بهرهوری در صنعت فناوری داشته باشد.
#هوش_مصنوعی #یادگیری_ماشین #تکنولوژی_پیشرفته #مدل_زبانی
🟣لینک مقاله:
https://inco.ai/blog/dflash2/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Behind the Scenes: Evolving Netflix's Ads Event Pipeline for Live (11 minute read)
🟢 خلاصه مقاله:
در پشت صحنه، نتفلیکس اقدام به بازطراحی خط لوله رویدادهای تبلیغاتی زنده خود کرده است. این تغییرات به منظور بهبود عملکرد و کارایی در مدیریت تبلیغات در حالت پویای زنده صورت گرفته است. در نسخه جدید، نتفلیکس از بستر Apache Flink بهرهمند شده که این پلتفرم امکان پردازش رویدادهای با حجم بالا و زمان حساس را فراهم میکند و توانمندیهای پیشرفتهای در این حوزه ارائه میدهد.
یکی از نکات برجسته در این بازطراحی این است که فرآیند غنیسازی متادیتا، که پیشتر جزو مسیر بحرانی عرضه تبلیغات محسوب میشد، از زنجیره اصلی و بحرانی سرویس تبلیغات خارج شده و به بخش پیوستنهای استریم حالتمند منتقل شده است. این تغییر باعث شده تا سرعت و استحکام سیستم در مقابل رویدادهای ناگهانی و دیررس افزایش پیدا کند و فرآیندهای پردازش بهتر و با دقت بیشتری انجام شوند.
در نتیجه، طراحی جدید قابلیت مسیریابی بر اساس منطقه جغرافیایی، مدیریت رویدادهای دیررس، بازیابی در فواصل ساعتی با بهرهگیری از Spark، حذف تکراریهای بدون تلاش کامل و تایید صحت عملیات با استفاده از دو مرحله اعتبارسنجی را دارد. این ویژگیها سبب شده است که توافق نهایی در حدود ۹۹.۹۹٪ قبل از کنار گذاشتن سیستم قدیمی، حاصل شود و اطمینان از عملیات بینقص، حفظ گردد.
این تحول نشاندهنده تمرکز نتفلیکس بر بهبود مستمر در زیرساختهای تبلیغاتی و استفاده از فناوریهای نوین جهت ارائه تجربه بهتر به کاربران و تبلیغدهندگان است. پیادهسازی این سیستم، نمونهای از تطابق فناوری با نیازهای روزافزون در عرصه استریم و تبلیغات زنده است که میتواند راهگشای مسیرهای نوین در صنعت باشد.
#نتفلیکس #تبلیغات_زنده #فناوری_پایدار #ApacheFlink
🟣لینک مقاله:
https://netflixtechblog.medium.com/behind-the-scenes-evolving-netflixs-ads-event-pipeline-for-live-part-ii-826ebf9ad9fb?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
Agentic Transaction: Towards ACID-Compliant Agent Systems (22 minute read)
🟢 خلاصه مقاله:
در مطالعهای جدید، محققان مفهومی نوآورانه را معرفی کردهاند که دنیای هوش مصنوعی و سیستمهای عاملی را به سمت اطمینان و پردازشهای قابل اعتماد هدایت میکند. در این رویکرد، مفهوم «معاملهگرایانه فعال» یا «Agentic Transaction» پذیرفته شده است؛ روشی که ویژگیهای تراکنشهای بانکها و سیستمهای مدیریت دادههای سنتی را به عاملهای هوشمند تعمیم میدهد. هدف اصلی این رویکرد این است که عملیاتهای چندمرحلهای در سیستمهای هوشمند، مانند اتخاذ تصمیمات پیچیده و پردازشهای چندمرحلهای، به صورت تراکنشهایی شبیهسازی شوند که قبل از تثبیت نتایج، یک فرآیند اعتبارسنجی کامل را طی میکنند.
در این مدل، همه فعالیتهای عاملهای هوشمند به گونهای طراحی شدهاند که در صورت وقوع خطا یا شکست، بتوان آنها را به حالت قبل از شروع برگرداند، دقیقا مانند تراکنشهای بانکها که در صورت مشکل، تمامی تغییرات ناپایدار لغو میشوند. علاوه بر این، این سیستمها قادرند تغییرات موثر و مهم را حفظ کرده و در صورت نیاز، آنها را دائمی و مقاوم نگه دارند، تا هرگونه نقص یا مشکل در حین عملیات، اثری بر عملکرد کلی نداشته باشد. به عبارتی دیگر، این رویکرد، هدایت و کنترل دقیق بر روند فعالیتهای عاملها را تضمین میکند و نظم و امنیت عملیات را در سیستمهای هوشمند بالا میبرد.
در آزمایشهای مقایسهای اخیر، پیادهسازی این معماری مبتنی بر ویژگیهای ACID که در مدیریت پایگاه دادهها مورد استفاده قرار میگیرند، نشان داد که عاملهای هوشمند با رعایت این استانداردها، نسبت به نمونههای معمول، تا ۱۰.۶ درصد در اجرای وظایف نسبتاً پیچیده، بهبود عملکرد داشتند. این نتایج نشان میدهد که معماریهایی متمرکز بر قابلیت اطمینان و صحت، همانند مقیاس و قدرت مدل، میتواند نقش حیاتی در توسعه عاملهای هوشمند ایفا کند؛ طوری که اعتمادپذیری و کارایی در پروژههای هوشمند، اهمیت هر چه بیشتری پیدا کند و توسعه سیستمهای عامل، بیش از پیش بر اصول استوار و مقاوم بنا شود.
در نتیجه، به نظر میرسد آینده سیستمهای عامل هوشمند، بیش از صرفاً قدرت محاسباتی و ظرفیتهای مدل، نیازمند ساختارهایی باشد که تمرکز آنها بر حفاظت، اطمینان و قابلیت اطمینان باشد. این رویکرد نوآورانه، میتواند راهگشای ساخت سیستمهایی باشد که نه تنها هوشمندانه عمل میکنند، بلکه در عین حال، در مواجهه با خطاها و ناپایدارهای احتمالی، مقاومت و پایداری لازم را دارند و اعتماد کاربران به فناوریهای هوشمند را تقویت میکنند.
#عامل_هوشمند #تراکنش_پذیری #امنیت_سیستم #هوش_مصنوعی
🟣لینک مقاله:
https://arxiv.org/html/2608.13900v1?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
🔵 عنوان مقاله
A Preview of DuckDB v2.0 (16 minute read)
🟢 خلاصه مقاله:
نسخه آینده DuckDB، یعنی نسخه ۲.۰، تحولی بزرگ در پلتفرم این پایگاه داده ایجاد میکند. در این نسخه، امکانات متنوعی افزوده شده است که امکانات اولیه و پایهای آن را به سطحی جدید میرساند. یکی از مهمترین بهروزرسانیها، امکان عملیات کلاینتسروری است که به کاربران اجازه میدهد تا از راه دور و در محیطهای توزیعشده به پایگاه داده متصل شوند و از امکانات آن بهرهمند گردند. علاوه بر این، ابزارهای جدیدی چون تریگرها به این نسخه اضافه شده است که کنترل دقیقتر و خودکارتر عملیاتهای داخل پایگاه داده را ممکن میسازد و سطح هوشمندی سیستم را افزایش میدهد.
یکی دیگر از ویژگیهای برجسته، پشتیبانی کامل از دادههای نیمهساختاری مانند نوع "VARIANT" است که امکان کار با دادههای متنوع و غیرساختاری را به شکل بهتر و مؤثرتری فراهم میکند. این قابلیت، کار با دادههای پیچیدهتر و غنیتر را در دنیای واقعی آسانتر میسازد. علاوه بر آن، در بخش ورودی و خروجی، از I/O ناهمزمان بهرهگیری شده است تا عملیاتها سریعتر و کارآمدتر انجام شوند و پاسخدهی سیستم به درخواستها بهبود یابد.
نسخه جدید همچنین یک پارسر SQL کاملاً جدید دارد که به بهبود عملکرد تفسیر و اجرای دستورات SQL کمک میکند، و در نتیجه، سرعت و کارایی کلی سیستم ارتقا یافته است. بهبودهای عمده در بخش ذخیرهسازی و اجرای کوئریها، باعث شده تا DuckDB توانایی پردازش حجم زیادی از دادهها را سریعتر و موثرتر داشته باشد، مخصوصاً در محیطهای حجیم و پیچیده. این تغییرات، DuckDB را برای کارهای تراکنشی بلندمدت و طولانیتر نیز بسیار مقاومتر و مطمئنتر میکند.
علاوه بر این، توسعه و نگهداری افزونهها در این نسخه آسانتر شده است؛ به طوری که توسعهدهندگان میتوانند افزونههای جدید را با سهولت بیشتری ساخته، توزیع و سازگاری با نسخههای مختلف سیستم را حفظ کنند. این تحولات کلی نشان میدهد که DuckDB در مسیر تبدیل شدن به یک پلتفرم جامع و بروزرسانی شده قرار دارد، که تمامی نیازهای امروزی کاربران و توسعهدهندگان را در زمینه بانکهای اطلاعاتی برآورده میکند.
#پایگاه_داده #DuckDB #برنامه_نویسی #توسعه
🟣لینک مقاله:
https://duckdb.org/2026/08/17/duckdb-20-highlights?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
884
درود دوستان 👋
اگر انتقاد یا پیشنهادی دارید که میتواند به بهبود چنلها کمک کند، خوشحال میشوم از نظرات شما استفاده کنم. میتوانید از طریق آیدی زیر با من در ارتباط باشید:
@mrbardia72
منتظر نظرات سازندهتان هستم! 📝
🚀 اگر میخواهید به تمام کانالهای تخصصی ما بهصورت یکجا دسترسی داشته باشید، از طریق لینک زیر عضو شوید:
https://t.me/addlist/nHHKekbfknUzMjA0
884
🔵 عنوان مقاله
Video Needs a Knowledge Base (6 minute read)
🟢 خلاصه مقاله:
در دنیای امروز، استفاده از ویدیوها با چالشهایی همراه است که بسیاری از کسبوکارها و کاربران را دچار مشکل میکند. هرچند فیلمها و کلیپها میتوانند به راحتی ذخیره و تماشا شوند، اما دشواری اصلی در جستجو و بهرهبرداری از محتوای آنها است. به دلیل عدم وجود قابلیت جستجوی داخلی در فایلهای ویدئویی، کاربران باید یا زمان زیادی را صرف مرور دستی محتوا کنند یا از فناوریهای هوش مصنوعی مکرر بهرهمند شوند تا اطلاعات مورد نیاز را استخراج کنند. این فرآیندها معمولاً وقتگیر و ناخوشایند هستند و بهرهوری را کاهش میدهد.
در پاسخ به این نیاز، پلتفرم شرکت CreativAI راهکاری نوآورانه ارائه داده است. این سیستم پس از ضبط ویدیو، آن را به صورت ساختاریافته و قابل جستجو تبدیل میکند. این فرآیند شامل سازماندهی و دستهبندی محتوای ویدیویی است به نحوی که حالا میتوان به راحتی و در کوتاهترین زمان ممکن، با جستجو در پایگاه دانش، اطلاعات مورد نیاز را پیدا کرد. این سیستم مخصوصاً در حوزههایی مانند رباتیک، لجستیک، ایمنی و انطباق قوانین، و کاربردهای فیزیکی هوش مصنوعی بسیار مفید واقع میشود.
این رویکرد باعث میشود که استفاده از ویدیوها نه تنها آسانتر بلکه بسیار کارآمدتر شود، زیرا میتوان به دادههای عظیم و پیچیده در مدت زمان کوتاهی دست یافت و تصمیمگیریهای بهتر و سریعتری انجام داد. بنابراین، تبدیل ویدیو به پایگاه دانش، گامی مهم در جهت بهرهوری حداکثری از محتواهای تصویری است که آینده هوش مصنوعی و فناوریهای مرتبط را شکل میدهد.
#هوش_مصنوعی #پایگاه_دانش #تکنولوژی #راندمان
🟣لینک مقاله:
https://creativ-ai.com/blogs/video-needs-a-knowledge-base?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
