en
Feedback
Database

Database

Open in Telegram

🕸 Database Academy حمایت مالی: https://www.coffeete.ir/mrbardia72 ادمین: @mrbardia72

Show more
884
Subscribers
No data24 hours
+17 days
+3630 days
Posts Archive
🔵 عنوان مقاله Zero-sum by design: 10 years of Uber's payments platform (8 minute read) 🟢 خلاصه مقاله: در دهه اخیر، پلتفرم پرداخت‌های اوبر، Gulfstream، به عنوان یکی از مهم‌ترین و پرکاربردترین زیرساخت‌های مالی این شرکت تبدیل شده است. این سیستم در حال حاضر توانایی پشتیبانی از بیش از ۲۱۷ میلیارد دلار در معاملات ناخالص سالانه را دارد که تقریباً دو برابر ارزش جابجایی‌های مالی در خود پلتفرم است. این رقم نشان‌دهنده کاربرد گسترده و اهمیت فوق‌العاده سیستم در عملیات‌های روزمره اوبر است. علاوه بر این، با بهره‌گیری از فناوری‌های پیشرفته، مجموعه‌ای از تعادل‌های حساب‌ررسی برای بیش از ۱.۲ میلیارد حساب فعال در پلتفرم مدیریت می‌شود، که نیاز به دقت و امنیت بالا در ثبت و جابجایی مالی دارد. در طراحی این سیستم، از سفارشات مالی با ذات ثابت و بدون تغییر، بهره‌برداری می‌شود که بر اساس مفهوم حسابداری دوطرفه ساخته شده است. این رویکرد اطمینان می‌دهد که هر تراکنش، به صورت کاملاً شفاف و قابل رهگیری ثبت می‌شود و در صورت نیاز، می‌توان تاریخچه کامل تمامی جابجایی‌ها را بررسی کرد. همچنین، داده‌ها در بانک اطلاعاتی DynamoDB نگهداری می‌شوند که امکان دسترسی سریع و مقیاس‌پذیری بالا را فراهم می‌کند. برای انتقال داده‌ها و مدیریت فرآیندهای در لحظه، از فناوری Kafka بهره گرفته شده است که جریان‌های داده‌ای را به صورت پیوسته و کارا مدیریت می‌کند. سیستم Cadence نیز نقش مهمی در تنظیم فرآیندهای هم‌زمان و هماهنگ ایفا می‌کند، که در عملیات‌هایی مانند تایید تراکنش و هماهنگی اطلاعات، موثر است. در کنار این موارد، این پلتفرم از رابط‌های عمومی و چندمنظوره برای ابزارهای پرداخت بهره می‌برد؛ این امر اجازه می‌دهد خطوط جدید کسب‌وکار به سرعت و با کم‌ترین تغییرات در هسته سیستم راه‌اندازی شوند، و انعطاف‌پذیری بالایی در توسعه و انطباق با نیازهای آینده فراهم گردد. در مجموع، اوبر با طراحی منحصربه‌فرد و استفاده از فناوری‌های نوین، بستر مطمئنی برای انجام تراکنش‌های مالی گسترده و قابل اطمینان ساخته است که توانسته بخش عمده‌ای از نیازهای مالی خود را به شکلی امن و مؤثر برآورده سازد. #پرداخت #فناوری #تراکنش_مالی #اوبر 🟣لینک مقاله: https://www.uber.com/us/en/blog/ubers-payments-platform/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله (Re)Building a FAQ System for DataTalks.Club (12 minute read) 🟢 خلاصه مقاله: در دنیای امروز، پاسخگویی سریع و دقیق به سوالات کاربران اهمیت زیادی دارد، به همین دلیل شرکت DataTalks.Club تصمیم گرفت سیستم پرسش و پاسخ خود را مجدداً بازطراحی کند. در این پروژه، تیم توسعه بر ساخت یک ربات FAQ مبتنی بر منابع متنوع تمرکز کرد. این منابع شامل مشکلات و دستورالعمل‌های مختص به پروژه در GitHub، بحث‌های موجود در Slack، و واژگان و گفتگوی‌های ضبط شده در ویدئوهای YouTube بودند. هدف از این کار ایجاد یک پایگاه داده غنی و قابل اعتماد بود که بتواند پاسخ‌های صحیح و به‌موقع را در اختیار کاربران قرار دهد. در این فرآیند، تیم تلاش کرد تا طراحی سیستم به گونه‌ای باشد که بدون نیاز به ساخت سرورهای مستقل، به راحتی در محیط‌های Serverless مانند AWS Lambda اجرا شود. این رویکرد نه تنها هزینه‌ها را کاهش می‌دهد بلکه نگهداری و توسعه را نیز ساده‌تر می‌کند. با این حال، برای اطمینان از کیفیت پاسخ‌ها، توجه خاصی به برچسب‌گذاری مناسب، مدیریت دسته‌های بررسی، و مکاشفه‌های هزینه‌بر مربوط به صحت پاسخ‌ها در نظر گرفته شد. به ویژه، بررسی دقیق مواردی که ممکن است منجر به رد نادرست یا بسته شدن زودهنگام گفتگوها شوند، اهمیت زیادی داشت. در نتیجه، این پروژه یادآوری مهمی است که کیفیت سیستم‌های پاسخگویی مبتنی بر اطلاعات باید از همان ابتدا با نگهداری منظم و دقیق داده‌ها تضمین شود. اگر داده‌ها خام و ناپایدار باشند، حتی بهترین الگوریتم‌ها هم نمی‌توانند جواب‌های مفید و مطمئن ارائه دهند. بنابراین، تمرکز بر مدیریت و بروزرسانی مداوم منبع داده‌ها، کلید موفقیت در توسعه سیستم‌های یادگیری و بازیابی اطلاعات است. #هوش_مصنوعی #سیستم‌های_پاسخگو #یادگیری_ماشین #توسعه_پایگاه_داده 🟣لینک مقاله: https://alexeyondata.substack.com/p/rebuilding-a-faq-system-for-datatalksclub?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Semi-Structured Data in Apache Iceberg: Meet the Variant Type (3 minute read) 🟢 خلاصه مقاله: در نسخه سوم Apache Iceberg، نوع جدیدی به نام «نوع متغیر» یا «Variant» معرفی شد که برای مدیریت داده‌های نیمه‌ساختاری طراحی شده است. این نوع به کاربران اجازه می‌دهد رکوردهای شبیه به JSON، که ممکن است به سرعت تغییر کنند، در یک ستون واحد ذخیره شوند و در عین حال نوع‌های اصلی مانند تایم‌استمپ‌ها، اعداد اعشاری، و مقادیر باینری حفظ شوند. این نوع مبتنی بر کدگذاری باینری پارکت است و با اکثر سیستم‌های پردازش داده مانند Spark و Flink سازگار است. از طریق SQL در Spark، می‌توانید به راحتی این نوع داده‌ها را با تابع variant_get فراخوانی و مورد استفاده قرار دهید. این قابلیت، انعطاف‌پذیری و کارایی در مدیریت داده‌های نیمه‌ساختاری را به جداسازی و تحلیل داده‌ها بیشتر کرده است. در نتیجه، معرفی نوع «متغیر» در Iceberg، راهکاری مدرن و عملی برای کار با داده‌های ناهمگون و دینامیک است که هم سازگاری با ابزارهای محبوب را فراهم می‌کند و هم امکان استخراج و تحلیل داده‌های پیچیده‌تر را برای توسعه‌دهندگان و تحلیل‌گران داده آسان‌تر می‌سازد. #داده_نیمه‌ساختاری #ApacheIceberg #پایگاه_داده #تحلیل_داده 🟣لینک مقاله: https://iceberg.apache.org/blog/variant-in-apache-iceberg/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

وقتی جدول دیتابیس میلیاردها سطر داره، چطور فقط همون تکه‌ای رو بخونیم که به کارمون میاد؟ دیتابیس که بزرگ میشه، فقط ایندکس کافی نیست. گاهی باید خودِ جدول رو تکه‌تکه کنیم تا موتور بتونه بخش‌های نامربوط رو کلاً نادیده بگیره. به این می‌گن پارتیشن‌بندی. توی این صفحه، چهار روش اصلی پارتیشن‌بندی RANGE، LIST، HASH و KEY رو بررسی کردم و تفاوت Partitioning با Sharding رو توضیح دادم. همچنین با یک مثال، الگوی Sliding Window رو بررسی کردم که چطور میشه بدون انجام DELETE های سنگین، داده‌های قدیمی رو آرشیو کرد. در نهایت هم تفاوت پیاده‌سازی این مفاهیم در SQL Server و MySQL رو بررسی کردم. اگه براتون مفید بود، خوشحال میشم یه ستاره بهش بدین. https://alireza-haeri.github.io/BackendDeepDives/DataPartitioning.html @| <AliReza Haeri/>

چند روز پیش ی پست گذاشتم راجع به DuckDB و اینکه میشه دیتای با حجم چند ۱۰ گیگ را راحت روی یک لپتاپ لود کرد و استفاده کرد. الان نیاز داشتم چندین گیگابایت دیگه هم بهش دیتا اضافه کنم. کل تعداد رکوردها رسید ۲۷۰,۱۶۰,۰۱۱ میلیون رکورد. و فایل دیتابیس شد ۱۴.۵ گیگ. ولی سرعت همچنان فوق العاده بالاست. دموی پایین: ارزونترین پلن Snowflake ماهی حدود ۱۰۰۰ دلار بود. خلاصه اینکه از این DuckDB و حتا sqlite (بسته به کاربردی که نیاز دارید) غافل نشید. @

Repost from Job
💼 به دنبال استخدام برنامه‌نویس هستید؟ یا به دنبال فرصت شغلی مناسب می‌گردید؟ 🟢 کارفرمایان: اگر به دنبال جذب برنامه‌نویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود. 🟢 کارجویان: اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکت‌ها و کارفرمایان معرفی شوید. 🚀 👤 ادمین: @mrbardia72 📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید: ✅ نام و نام خانوادگی (اجباری) ✅ سابقه کار (اجباری) ✅ محل سکونت (اجباری) ✅ امکان نقل مکان برای کار (اجباری) 🔹 لینک LinkedIn (اختیاری) 🔹 لینک GitHub (اختیاری)

🔵 عنوان مقاله Spark Tips. Partition Tuning (12 minute read) 🟢 خلاصه مقاله: در تنظیم اندازه‌ بخش‌های اسپارک، هدف اصلی بهینه‌سازی بهره‌وری و پایداری سیستم است. باید تلاش کنیم تعداد بخش‌ها به قدری باشد که بتوانیم از تمام هسته‌های موجود بهره‌برداری کنیم، بدون اینکه وظایف بسیار کوچک ایجاد کنیم که زمان پردازش را افزایش می‌دهد. بهتر است عملیات فیلتر را در مراحل اولیه انجام دهیم تا حجم داده‌هایی که باید منتقل و پردازش شوند کاهش یابد. همچنین، نباید بر داده‌های غیرضروری shuffle انجام دهیم و در مواقعی که ساختار فعلی داده‌ها مناسب نیست، مجدداً بخش‌بندی داده‌ها را برای بهتر شدن عملیات‌های join یا نوشتن انجام دهیم. در راهنمای عملی، نکاتی مانند قابلیت خودکار بهینه‌سازی کیفیت اطلاعات (AQE)، مشکلات ناشی از توزیع نابرابر داده‌ها (Skew)، مشکلات مربوط به spilling و استفاده از نقاط کنترل (checkpoint barriers) مورد بحث قرار می‌گیرند. علاوه بر این، توازن میان فایل‌های کوچک و بزرگ نیز اهمیت دارد و نیاز است تا با توجه به نوع داده‌ها و عملیات، تنظیمات بهینه را اعمال کنیم. رعایت این موارد به بهبود عملکرد و کاهش مشکلات سیستم کمک می‌کند و به ما اجازه می‌دهد تا منابع را بهتر مدیریت کنیم. #اسپارک #بهینه‌سازی #پایداریداده #توزیع داده‌ها 🟣لینک مقاله: https://luminousmen.substack.com/p/spark-tips-partition-tuning?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله We will ship the first Polars 2.0 release candidate next week (1 minute read) 🟢 خلاصه مقاله: ما هفته آینده اولین نسخه آزمایشی رسمی از نرم‌افزار Polars 2.0 را منتشر خواهیم کرد. این نسخه که به عنوان "کاندیدا" شناخته می‌شود، مرحله‌ای مهم در فرآیند توسعه است، زیرا نشانگر آمادگی این نسخه برای عرضه نهایی است و فرصت خوبی است برای کاربران و توسعه‌دهندگان تا بازخوردهای خود را ارائه دهند و مشکلات احتمالی را شناسایی کنند. نسخه 2.0 از Polars در حال حاضر در مراحل نهایی قرار دارد و تیم توسعه کاملاً بر روی اصلاح نقاط ضعف و بهبود عملکرد آن تمرکز کرده است. این نسخه شامل ویژگی‌های جدید و بهبودهای قابل توجهی است که هدفشان بهبود کارایی و سهولت استفاده است. انتظار می‌رود با انتشار این نسخه، کاربران تجربه کاربری بهتر و ابزارهای قدرتمندتری در اختیار داشته باشند، که این امر می‌تواند تاثیر قابل توجهی در پروژه‌های داده‌کاوی و آنالیزهای حجیم داشته باشد. با نزدیک شدن به تاریخ انتشار، تیم توسعه فعالانه در حال جمع‌آوری بازخوردها و رفع خطاهای احتمالی است تا نسخه نهایی با بهترین کیفیت ممکن ارائه شود. این مرحله اهمیت ویژه‌ای دارد، چرا که نتیجه نهایی باید تمام نیازها و انتظارات کاربران را برآورده کند و تجربه کاری رضایت‌بخش را فراهم آورد. پیش‌بینی می‌شود با عرضه نسخه آزمایشی، جامعه کاربری و توسعه‌دهندگان به همکاری بیشتر تشویق شوند و نظرات ارزشمندی درباره نهایی‌سازی ویژگی‌ها ارائه دهند. این تعامل مستقیم کمک می‌کند تا Polars 2.0 نه تنها یک به‌روزرسانی کوچک بلکه یک تغییر اساسی در امکانات و کارایی باشد. منتظر باشید، چرا که هفته آینده با انتشار این نسخه آزمایشی، تحولات جدید در انتظار شماست و بهبودهای چشمگیر در انتظار پروژه‌های داده‌کاوی شما قرار دارد. #پولارس #نسخه۲٫۰ #داده‌کاوی #توسعه 🟣لینک مقاله: https://threadreaderapp.com/thread/2089338347286093851.html?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Postgres 19: How Our Advice Has Changed Since We Wrote It (16 minute read) 🟢 خلاصه مقاله: در نسخه‌ی جدید پستگرس ۱۹، تغییرات عمده‌ای صورت نگرفته است، بلکه بیشتر بر تقویت روش‌های اثبات‌شده گذشته تمرکز شده است. این نسخه با توسعه فناوری I/O غیرهمزمان و افزودن قابلیت‌های خودکار در مقیاس‌پذیری، عملکرد سیستم‌های پایگاه داده را بهبود می‌بخشد. علاوه‌بر این، امکاناتی مانند نسخه‌پذیری قوی‌تر عملیات COPY، استفاده پیش‌فرض از فشرده‌سازی LZ4، بهبود در سیستم‌های ایندکس‌گذاری و مدیریت راحت‌تر بخش‌بندی‌ها، از جمله ویژگی‌های برجسته آن هستند. نکات کلیدی در طراحی و نگهداری پایگاه داده هنوز هم همان اصول اولیه باقی‌مانده است: بهره‌گیری از دستور COPY برای بارگذاری داده‌های انبوه، مدل‌سازی داده‌های پرترافیک به صورت ساختاری، انتخاب هوشمندانه ایندکس‌ها و استفاده از بخش‌بندی بیشتر برای مدیریت چرخه عمر داده‌ها. این تحولات، کمک می‌کنند تا توسعه‌دهندگان و مدیران پایگاه داده بتوانند بهتر و کارآمدتر روی پروژه‌های خود کار کنند، بدون اینکه نیاز به تغییر بنیادین در استراتژی‌های خود باشد. #پستگرس #پایگاه_داده #مدیریت_داده #توسعه_نرم‌افزار 🟣لینک مقاله: https://www.crunchydata.com/blog/postgres-19-how-our-advice-has-changed-since-we-wrote-it?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله I spent 10 hours vibe-coding a tool to visualize any Parquet file's internals (2 minute read) 🟢 خلاصه مقاله: در دوی ساعت گذشته، من به مدت ۱۰ ساعت صرف برنامه‌نویسی و توسعه ابزاری در مرورگر کردم که قادر است ساختار داخلی هر فایل پارکت را به وضوح نشان دهد. این ابزار کوچک با استفاده از زبان برنامه‌نویسی Rust و کتابخانه‌ی arrow-rs طراحی شده است و وظیفه آن تحلیل و نمایش جزئیات فایل‌های پارکت است که معمولاً پنهان می‌مانند. این ابزار قادر است بخش‌های مختلف فایل، مانند گروه‌های ردیفی، تکه‌های ستون‌ها، صفحات، اسکیم‌ها، کدگذاری‌ها، فیلترهای بلوم، اندازه‌ها، و آمار حداقل و حداکثر را به صورت گرافیکی و قابل فهم نمایش دهد. به این ترتیب، توسعه‌دهندگان، دانش‌اموزان و محققان می‌توانند با استفاده از این ابزار، درک بهتری نسبت به جزئیات فایل‌های ستونی پیدا کنند که نقش مهمی در بهبود فرآیندهای تحلیل داده و اشکال‌زدایی ایفا می‌کند. این ابزار نه تنها برای آموزش مفید است بلکه در فرآیندهای اشکال‌زدایی و بهینه‌سازی فایل‌های پارکت، کمک قابل توجهی می‌کند. در واقع، این پروژه نشان می‌دهد چطور می‌توان با بهره‌گیری از فناوری‌های مدرن و زبان‌های برنامه‌نویسی قدرتمند، ابزارهای کارآمدی ساخته و دانش فنی خود را توسعه داد. #تحلیل_فایل_پارتک #برنامه‌نویسی #دیتا_فناوری #ابزارهای_دیجیتال 🟣لینک مقاله: https://vutr.substack.com/p/i-spent-10-hours-vibe-coding-a-tool?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Simplifying data and product integrations with a data abstraction layer (8 minute read) 🟢 خلاصه مقاله: در دنیای پرسرعت امروزی، یکپارچه‌سازی داده‌ها و محصولات یکی از چالش‌های مهم شرکت‌ها است. Uber توانسته است با بهره‌گیری از یک لایه انتزاع داده (Data Abstraction Layer) راه‌حلی کارآمد و انعطاف‌پذیر ارائه دهد که فرآیندهای مربوط به ادغام داده‌ها را بسیار ساده‌تر و سریع‌تر می‌کند. این فناوری، اتصال میان محصولات و داده‌های مختلف را از قید و بند تغییرات در جداول فیزیکی، ساختارهای اطلاعاتی و زیرساخت‌های پشتیبانی آزاد می‌سازد و امکان توسعه و به‌روزرسانی سریع‌تر سیستم‌ها را فراهم می‌آورد. در این روش، لایه انتزاع داده‌ها شامل جداول منطقی است که به صورت مجازی ایجاد شده و به کمک API خاص FetchData، قادر است درخواست‌های متعدد را به طور همزمان و کارآمد از منابع مختلف مانند جداول لحظه‌ای و روزانه، مخازن OLAP، دیتاستور، داک‌استور و هایو پردازش کند. این ساختار، سوای اینکه نیاز به تغییرات مکرر در ساختارهای فیزیکی باشد، امکان جمع‌آوری و تحلیل داده‌های متنوع را فراهم می‌آورد. به عنوان مثال، داده‌های مربوط به گزارش‌گری تبلیغاتی، که پیش‌تر هفته‌ها زمان می‌برد، اکنون در مدت زمان کمتر از دو روز قابل دستیابی است، که تاثیر قابل توجهی بر کارایی و سرعت تصمیم‌گیری‌های استراتژیک دارد. در مجموع، این رویکرد نه تنها فرآیندهای داده‌ای را تسهیل می‌کند، بلکه باعث افزایش دقت، کاهش خطاها و بهبود کارایی عملیاتی می‌شود. Uber با بهره‌گیری از لایه انتزاع داده، آینده‌ای پر از نوآوری و پاسخگویی سریع به نیازهای بازار را ترسیم کرده است که می‌تواند الگوی موفقی برای دیگر شرکت‌ها در حوزه فناوری و داده باشد. #مدیریت_داده #یکپارچه_سازی_داده #تحلیل_در_زمان_واقعی #فناوری 🟣لینک مقاله: https://www.uber.com/us/en/blog/data-abstraction-layer/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله We turned off Pub/Sub and nobody noticed (17 minute read) 🟢 خلاصه مقاله: تیم Incident.io با هدف ارتقاء سطح اطمینان‌پذیری سیستم‌های خود، تصمیم گرفتند سرویس Pub/Sub گوگل را غیرفعال کنند. این اقدام در حالی صورت گرفت که تمامی اعضای تیم و کاربران متوجه تغییر نشدند، چرا که این پروسه به گونه‌ای طراحی شده بود که بدون توقف یا اختلال در کارکرد سیستم انجام شود. برای رسیدن به این هدف، تیم اقدام به جایگزینی Pub/Sub با ناتس (NATS) كرد و سپس یک تعادل‌بار فعال-فعال (Active-Active Load Balancer) پیاده‌سازی کردند. این تعادل‌بار به صورت خودکار پیام‌ها را بین هر دو ساب‌سیستم توزیع می‌کرد، به گونه‌ای که در صورت بروز هرگونه مشکل در یک بخش، دیگری به طور پیوسته وظیفه را بر عهده داشت و سیستم عملکرد بدون مشکل خود را حفظ می‌کرد. در مراحل آزمایش، تیم تمام سرویس Pub/Sub را به طور کامل غیرفعال کرد و عملکرد سیستم را زیر نظر گرفت تا اطمینان حاصل کند که هیچ پیام از دست نمی‌رود و هیچ تأثیر منفی بر تجربه کاربری ندارد. نتایج این آزمایش‌ها بسیار رضایت‌بخش بود؛ هیچ پیام گم نشده، خطای ناپیدا و هیچ پیامد منفی برای کاربران مشاهده نشد. این راهکار نشان داد که با طراحی مناسب و استفاده از فناوری‌های نوین، می‌توان سیستم‌های حساس و مهم را بدون توقف بهبود بخشید و از بروز علائم نقطه ضعف در زیرساخت‌های حیاتی جلوگیری کرد. #پاسخگویی_پایدار #مدیریت_پرسنل #تسریع_توسعه #تکنولوژی_نواوری 🟣لینک مقاله: https://incident.io/blog/we-turned-off-pub-sub-and-nobody-noticed?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Massively parallel Postgres backups (7 minute read) 🟢 خلاصه مقاله: در دنیای مدیریت پایگاه‌های داده، بکاپ‌گیری سریع و مطمئن همواره یکی از چالش‌های مهم محسوب می‌شود. اخیراً، طراحی جدید PlanetScale برای بکاپ‌گیری از پایگاه داده‌های پستگرس به صورت هم‌زمان و موازی تحولی بزرگ در این حوزه ایجاد کرده است. این سیستم، هر بخش (شارد) از پایگاه داده را به عنوان یک عامل مستقل در نظر می‌گیرد که وظیفه دارد نسخه‌ی پشتیبان سالم، کامل و سریع را بازیابی کند. در واقع، هر شارد به عنوان یک نیروی مجزا عمل می‌کند که می‌تواند عملیات بازسازی، بازیابی از S3، تکرار WAL و تثبیت یک نقطه‌ی زمانی معین را به صورت هم‌زمان انجام دهد. این رویکرد باعث شده فرآیند بکاپ‌گیری چندین برابر سریع‌تر و کارآمدتر باشد، تا جایی که زمان لازم برای تهیه یک نسخه کامل در عرض چند دقیقه کاهش یافته است. این طراحی نوآورانه با بهره‌گیری از مفهوم تقسیم وظایف، امکان انجام عملیات‌های هم‌زمان را فراهم می‌آورد. هر شارد به صورت هم‌زمان می‌تواند عملیات بازیابی، تکرار لاگ تراکنش‌های WAL و تثبیت داده‌ها را انجام دهد، بدون اینکه تأثیر منفی بر روی سایر بخش‌ها داشته باشد. نتیجه این است که تهیه نسخه پشتیبان کامل و سازگار، در کوتاه‌ترین زمان ممکن انجام می‌شود، که این موضوع برای کسب‌وکارهای حساس به زمان و نیازمند بازیابی سریع بسیار حیاتی است. این رویکرد انقلابی در طراحی‌های مرسوم، پتانسیل تغییر شیوه‌ی مدیریت و نگهداری نسخه‌های پشتیبان را دارد و به مدیران داده‌ها امکان می‌دهد انعطاف‌پذیری و ضریب اطمینان بیشتری در عملیات‌های بکاپ‌گیری داشته باشند. در کل، این فناوری، که به صورت موازی و هم‌زمان عملیات بازیابی را انجام می‌دهد، نه تنها زمان مورد نیاز برای بکاپ‌گیری را به شدت کاهش می‌دهد، بلکه سطح اطمینان و صحت داده‌ها را نیز افزایش می‌دهد. پیاده‌سازی چنین سیستمی به نقل قول، نشان‌دهنده‌ی پیشرفت‌های قابل توجه در حوزه فناوری‌های مدیریت پایگاه داده است که می‌تواند تاثیرات بلندمدتی در بهره‌وری و امنیت داده‌ها داشته باشد. #پایگاه_داده #پستگرس #بکاپ_پیشنهاد_موازی #مدیریت_پایگاه 🟣لینک مقاله: https://planetscale.com/blog/massively-parallel-postgres-backups?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Software engineering at a proprietary trading company: Optiver (17 minute read) 🟢 خلاصه مقاله: شرکت نهادهای تجاری اختصاصی، مانند اوتیور، نمونه‌ای بارز از نحوه تأثیر مستقیم فناوری بر سود و زیان در صنعت مالی است. سیستم این شرکت، نشان‌دهنده ارتباط مستقیم میان کاهش تأخیر، افزایش قابلیت اطمینان و کیفیت یادگیری ماشین با موفقیت‌های مالی است. تیم‌های فنی این شرکت، که حدود ۹۵۰ مهندس را شامل می‌شوند، روزانه بیش از ۱۰ میلیون معامله در بازارهای مختلف انجام می‌دهند. این عملیات گسترده روی زیرساختی متنوع صورت می‌گیرد که شامل زبان‌های برنامه‌نویسی قدرتمندی مانند C++، Python، Rust، سیستم‌های پیام‌رسان Kafka، پایگاه داده‌های Postgres، پلتفرم‌های پردازش داده مانند Databricks، هسته‌های لینوکس سفارشی و سخت‌افزارهای مستقر در مکان‌های مختلف است. در این فضای فناوری، رویکرد اصلی بر مالکیت عمیق و کامل زیرساخت‌ها استوار است، نه تنها تمرکز بر سرعت‌گذاری سطحی. این فرهنگ باعث شده است که هر بخش، به صورت تخصصی و جامع در توسعه و نگهداری زیرساخت‌های مورد نیاز خود نقش داشته باشد. نتیجه‌اش سیستم‌هایی کارآمد و مقاوم است که توانایی پاسخگویی به نیازهای پیچیده معاملات مالی را دارند. در نتیجه، حافظه‌های فنی و فناوری این شرکت نشان‌دهنده تعهد به ساختارهای مستحکم و بهبود مستمر است که در نهایت سودآوری و پایداری کسب‌وکار را تضمین می‌کند. #فناوری #هوش_مصنوعی #تجارت_رایانه‌ای #زیرساخت 🟣لینک مقاله: https://newsletter.pragmaticengineer.com/p/optiver?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله DFlash 2: Keep Drafting Parallel (10 minute read) 🟢 خلاصه مقاله: در دفلش ۲، فرآیند رمزگشایی تئوری بسیار بهبود یافته است. این فناوری اجازه می‌دهد که فرآیند پیش‌بینی و رمزگشایی مدل‌های زبانی بزرگ (LLM) بسیار سریع‌تر انجام شود، به طوری که تخمین زده می‌شود سرعت استنتاج آن حدود سه برابر افزایش یافته است. یکی از اصلی‌ترین ویژگی‌های این فناوری، توانایی پذیرش تعداد بیشتری توکن در هر بار پردازش است، در حالی که نتیجه نهایی و خروجی مدل دست‌نخورده باقی می‌ماند. این یعنی زمان مورد نیاز برای تولید متن کاهش یافته است، بدون این که کیفیت یا دقت نتایج کاهش یابد یا تفاوتی در خروجی نهایی ایجاد شود. این پیشرفت، به ویژه در کاربردهای عملی و اجرایی، کارایی و سرعت سیستم‌های مبتنی بر هوش مصنوعی را به شدت ارتقاء می‌دهد. می‌توان تصور کرد که در آینده، این فناوری امکان پاسخ‌دهی سریع‌تر در چت‌بات‌ها، ترجمه‌های فوری و دیگر برنامه‌های زبانی را فراهم کند و دقت و کارایی این سیستم‌ها را به طور چشم‌گیری افزایش دهد. بنابراین، دفلش ۲ نه تنها یک بهبود فنی است، بلکه در راستای تسهیل و بهبود تجربه کاربری نهایی نقش مهمی ایفا می‌کند. در نتیجه، توسعه این فناوری گامی مهم در مسیر بهبود سرعت و بهره‌وری مدل‌های زبانی بزرگ است و می‌تواند تاثیر زیادی بر توسعه کاربردهای هوشمند و افزایش بهره‌وری در صنعت فناوری داشته باشد. #هوش_مصنوعی #یادگیری_ماشین #تکنولوژی_پیشرفته #مدل_زبانی 🟣لینک مقاله: https://inco.ai/blog/dflash2/?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Behind the Scenes: Evolving Netflix's Ads Event Pipeline for Live (11 minute read) 🟢 خلاصه مقاله: در پشت صحنه، نتفلیکس اقدام به بازطراحی خط لوله رویدادهای تبلیغاتی زنده خود کرده است. این تغییرات به منظور بهبود عملکرد و کارایی در مدیریت تبلیغات در حالت پویای زنده صورت گرفته است. در نسخه جدید، نتفلیکس از بستر Apache Flink بهره‌مند شده که این پلتفرم امکان پردازش رویدادهای با حجم بالا و زمان حساس را فراهم می‌کند و توانمندی‌های پیشرفته‌ای در این حوزه ارائه می‌دهد. یکی از نکات برجسته در این بازطراحی این است که فرآیند غنی‌سازی متادیتا، که پیش‌تر جزو مسیر بحرانی عرضه تبلیغات محسوب می‌شد، از زنجیره اصلی و بحرانی سرویس تبلیغات خارج شده و به بخش پیوستن‌های استریم حالت‌مند منتقل شده است. این تغییر باعث شده تا سرعت و استحکام سیستم در مقابل رویدادهای ناگهانی و دیررس افزایش پیدا کند و فرآیندهای پردازش بهتر و با دقت بیشتری انجام شوند. در نتیجه، طراحی جدید قابلیت مسیریابی بر اساس منطقه جغرافیایی، مدیریت رویدادهای دیررس، بازیابی در فواصل ساعتی با بهره‌گیری از Spark، حذف تکراری‌های بدون تلاش کامل و تایید صحت عملیات با استفاده از دو مرحله اعتبارسنجی را دارد. این ویژگی‌ها سبب شده است که توافق نهایی در حدود ۹۹.۹۹٪ قبل از کنار گذاشتن سیستم قدیمی، حاصل شود و اطمینان از عملیات بی‌نقص، حفظ گردد. این تحول نشان‌دهنده تمرکز نتفلیکس بر بهبود مستمر در زیرساخت‌های تبلیغاتی و استفاده از فناوری‌های نوین جهت ارائه تجربه بهتر به کاربران و تبلیغ‌دهندگان است. پیاده‌سازی این سیستم، نمونه‌ای از تطابق فناوری با نیازهای روزافزون در عرصه استریم و تبلیغات زنده است که می‌تواند راه‌گشای مسیرهای نوین در صنعت باشد. #نتفلیکس #تبلیغات_زنده #فناوری_پایدار #ApacheFlink 🟣لینک مقاله: https://netflixtechblog.medium.com/behind-the-scenes-evolving-netflixs-ads-event-pipeline-for-live-part-ii-826ebf9ad9fb?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله Agentic Transaction: Towards ACID-Compliant Agent Systems (22 minute read) 🟢 خلاصه مقاله: در مطالعه‌ای جدید، محققان مفهومی نوآورانه را معرفی کرده‌اند که دنیای هوش مصنوعی و سیستم‌های عاملی را به سمت اطمینان و پردازش‌های قابل اعتماد هدایت می‌کند. در این رویکرد، مفهوم «معامله‌گرایانه فعال» یا «Agentic Transaction» پذیرفته شده است؛ روشی که ویژگی‌های تراکنش‌های بانک‌ها و سیستم‌های مدیریت داده‌های سنتی را به عامل‌های هوشمند تعمیم می‌دهد. هدف اصلی این رویکرد این است که عملیات‌های چندمرحله‌ای در سیستم‌های هوشمند، مانند اتخاذ تصمیمات پیچیده و پردازش‌های چندمرحله‌ای، به صورت تراکنش‌هایی شبیه‌سازی شوند که قبل از تثبیت نتایج، یک فرآیند اعتبارسنجی کامل را طی می‌کنند. در این مدل، همه فعالیت‌های عامل‌های هوشمند به گونه‌ای طراحی شده‌اند که در صورت وقوع خطا یا شکست، بتوان آن‌ها را به حالت قبل از شروع برگرداند، دقیقا مانند تراکنش‌های بانک‌ها که در صورت مشکل، تمامی تغییرات ناپایدار لغو می‌شوند. علاوه بر این، این سیستم‌ها قادرند تغییرات موثر و مهم را حفظ کرده و در صورت نیاز، آن‌ها را دائمی و مقاوم نگه دارند، تا هرگونه نقص یا مشکل در حین عملیات، اثری بر عملکرد کلی نداشته باشد. به عبارتی دیگر، این رویکرد، هدایت و کنترل دقیق بر روند فعالیت‌های عامل‌ها را تضمین می‌کند و نظم و امنیت عملیات را در سیستم‌های هوشمند بالا می‌برد. در آزمایش‌های مقایسه‌ای اخیر، پیاده‌سازی این معماری مبتنی بر ویژگی‌های ACID که در مدیریت پایگاه داده‌ها مورد استفاده قرار می‌گیرند، نشان داد که عامل‌های هوشمند با رعایت این استانداردها، نسبت به نمونه‌های معمول، تا ۱۰.۶ درصد در اجرای وظایف نسبتاً پیچیده، بهبود عملکرد داشتند. این نتایج نشان می‌دهد که معماری‌هایی متمرکز بر قابلیت اطمینان و صحت، همانند مقیاس و قدرت مدل، می‌تواند نقش حیاتی در توسعه عامل‌های هوشمند ایفا کند؛ طوری که اعتمادپذیری و کارایی در پروژه‌های هوشمند، اهمیت هر چه بیشتری پیدا کند و توسعه سیستم‌های عامل، بیش از پیش بر اصول استوار و مقاوم بنا شود. در نتیجه، به نظر می‌رسد آینده سیستم‌های عامل هوشمند، بیش از صرفاً قدرت محاسباتی و ظرفیت‌های مدل، نیازمند ساختارهایی باشد که تمرکز آنها بر حفاظت، اطمینان و قابلیت اطمینان باشد. این رویکرد نوآورانه، می‌تواند راه‌گشای ساخت سیستم‌هایی باشد که نه تنها هوشمندانه عمل می‌کنند، بلکه در عین حال، در مواجهه با خطاها و ناپایدارهای احتمالی، مقاومت و پایداری لازم را دارند و اعتماد کاربران به فناوری‌های هوشمند را تقویت می‌کنند. #عامل_هوشمند #تراکنش_پذیری #امنیت_سیستم #هوش_مصنوعی 🟣لینک مقاله: https://arxiv.org/html/2608.13900v1?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

🔵 عنوان مقاله A Preview of DuckDB v2.0 (16 minute read) 🟢 خلاصه مقاله: نسخه آینده DuckDB، یعنی نسخه ۲.۰، تحولی بزرگ در پلتفرم این پایگاه داده ایجاد می‌کند. در این نسخه، امکانات متنوعی افزوده شده است که امکانات اولیه و پایه‌ای آن را به سطحی جدید می‌رساند. یکی از مهم‌ترین به‌روزرسانی‌ها، امکان عملیات کلاینت‌سروری است که به کاربران اجازه می‌دهد تا از راه دور و در محیط‌های توزیع‌شده به پایگاه داده متصل شوند و از امکانات آن بهره‌مند گردند. علاوه بر این، ابزارهای جدیدی چون تریگرها به این نسخه اضافه شده است که کنترل دقیق‌تر و خودکارتر عملیات‌های داخل پایگاه داده را ممکن می‌سازد و سطح هوشمندی سیستم را افزایش می‌دهد. یکی دیگر از ویژگی‌های برجسته، پشتیبانی کامل از داده‌های نیمه‌ساختاری مانند نوع "VARIANT" است که امکان کار با داده‌های متنوع و غیرساختاری را به شکل بهتر و مؤثرتری فراهم می‌کند. این قابلیت، کار با داده‌های پیچیده‌تر و غنی‌تر را در دنیای واقعی آسان‌تر می‌سازد. علاوه بر آن، در بخش ورودی و خروجی، از I/O ناهم‌زمان بهره‌گیری شده است تا عملیات‌ها سریع‌تر و کارآمدتر انجام شوند و پاسخ‌دهی سیستم به درخواست‌ها بهبود یابد. نسخه جدید همچنین یک پارسر SQL کاملاً جدید دارد که به بهبود عملکرد تفسیر و اجرای دستورات SQL کمک می‌کند، و در نتیجه، سرعت و کارایی کلی سیستم ارتقا یافته است. بهبودهای عمده در بخش ذخیره‌سازی و اجرای کوئری‌ها، باعث شده تا DuckDB توانایی پردازش حجم زیادی از داده‌ها را سریع‌تر و موثرتر داشته باشد، مخصوصاً در محیط‌های حجیم و پیچیده. این تغییرات، DuckDB را برای کارهای تراکنشی بلندمدت و طولانی‌تر نیز بسیار مقاومتر و مطمئن‌تر می‌کند. علاوه بر این، توسعه و نگهداری افزونه‌ها در این نسخه آسان‌تر شده است؛ به طوری که توسعه‌دهندگان می‌توانند افزونه‌های جدید را با سهولت بیشتری ساخته، توزیع و سازگاری با نسخه‌های مختلف سیستم را حفظ کنند. این تحولات کلی نشان می‌دهد که DuckDB در مسیر تبدیل شدن به یک پلتفرم جامع و بروزرسانی شده قرار دارد، که تمامی نیازهای امروزی کاربران و توسعه‌دهندگان را در زمینه بانک‌های اطلاعاتی برآورده می‌کند. #پایگاه_داده #DuckDB #برنامه_نویسی #توسعه 🟣لینک مقاله: https://duckdb.org/2026/08/17/duckdb-20-highlights?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy

درود دوستان 👋 اگر انتقاد یا پیشنهادی دارید که می‌تواند به بهبود چنل‌ها کمک کند، خوشحال می‌شوم از نظرات شما استفاده کنم. می‌توانید از طریق آی‌دی زیر با من در ارتباط باشید: @mrbardia72 منتظر نظرات سازنده‌تان هستم! 📝 🚀 اگر می‌خواهید به تمام کانال‌های تخصصی ما به‌صورت یکجا دسترسی داشته باشید، از طریق لینک زیر عضو شوید: https://t.me/addlist/nHHKekbfknUzMjA0

🔵 عنوان مقاله Video Needs a Knowledge Base (6 minute read) 🟢 خلاصه مقاله: در دنیای امروز، استفاده از ویدیوها با چالش‌هایی همراه است که بسیاری از کسب‌وکارها و کاربران را دچار مشکل می‌کند. هرچند فیلم‌ها و کلیپ‌ها می‌توانند به راحتی ذخیره و تماشا شوند، اما دشواری اصلی در جستجو و بهره‌برداری از محتوای آن‌ها است. به دلیل عدم وجود قابلیت جستجوی داخلی در فایل‌های ویدئویی، کاربران باید یا زمان زیادی را صرف مرور دستی محتوا کنند یا از فناوری‌های هوش مصنوعی مکرر بهره‌مند شوند تا اطلاعات مورد نیاز را استخراج کنند. این فرآیندها معمولاً وقت‌گیر و ناخوشایند هستند و بهره‌وری را کاهش می‌دهد. در پاسخ به این نیاز، پلتفرم شرکت CreativAI راه‌کاری نوآورانه ارائه داده است. این سیستم پس از ضبط ویدیو، آن را به صورت ساختاریافته و قابل جستجو تبدیل می‌کند. این فرآیند شامل سازمان‌دهی و دسته‌بندی محتوای ویدیویی است به نحوی که حالا می‌توان به راحتی و در کوتاه‌ترین زمان ممکن، با جستجو در پایگاه دانش، اطلاعات مورد نیاز را پیدا کرد. این سیستم مخصوصاً در حوزه‌هایی مانند رباتیک، لجستیک، ایمنی و انطباق قوانین، و کاربردهای فیزیکی هوش مصنوعی بسیار مفید واقع می‌شود. این رویکرد باعث می‌شود که استفاده از ویدیوها نه تنها آسان‌تر بلکه بسیار کارآمدتر شود، زیرا می‌توان به داده‌های عظیم و پیچیده در مدت زمان کوتاهی دست یافت و تصمیم‌گیری‌های بهتر و سریع‌تری انجام داد. بنابراین، تبدیل ویدیو به پایگاه دانش، گامی مهم در جهت بهره‌وری حداکثری از محتواهای تصویری است که آینده هوش مصنوعی و فناوری‌های مرتبط را شکل می‌دهد. #هوش_مصنوعی #پایگاه_دانش #تکنولوژی #راندمان 🟣لینک مقاله: https://creativ-ai.com/blogs/video-needs-a-knowledge-base?utm_source=tldrdata ➖➖➖➖➖➖➖➖ 👑 @Database_Academy