fa
Feedback
Data Engineering / Инженерия данных / Data Engineer / DWH

Data Engineering / Инженерия данных / Data Engineer / DWH

رفتن به کانال در Telegram

Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru

نمایش بیشتر
2 689
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+27 روز
+2130 روز
آرشیو پست ها
🤖 Что такое SDD и зачем он нужен? Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подро
🤖 Что такое SDD и зачем он нужен? Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подробная спецификация, а уже потом AI-агент реализует задачу. Вместо: «Напиши мне эту фичу» → код получаем: Требования → Specification → Plan → Tasks → Code → Tests Зачем это нужно? AI-агент умеет быстро писать код, но может неправильно понять задачу. Спецификация фиксирует что именно нужно сделать, ограничения, архитектуру и критерии готовности. SDD превращает AI-кодинг из хаотичного *vibe coding* в управляемый инженерный процесс. 📚 Подробный разбор SDD и инструментов для работы с AI-агентами: 👉 https://datatalks.ru/spec-driven-development/index.html #AI #AIAgents #SDD #SpecDrivenDevelopment #ClaudeCode #Codex #SoftwareEngineering

🆕 PySpark нейролекции Возможно кому-то поможет в освоении PySpark. С одной стороны нейрослоп и повторы между лекциями, с другой стороны некоторые концепции хорошо прописаны. Раздел с подготовкой к интервью собирался с разных сайтов и материалов. https://datatalks.ru/pyspark/

🚀 Claude перевел книгу «The Fundamentals of Building a Lakehouse» на русский язык. Если вы хотите разобраться, что такое Lak
🚀 Claude перевел книгу «The Fundamentals of Building a Lakehouse» на русский язык. Если вы хотите разобраться, что такое Lakehouse, эта книга — отличная отправная точка. В ней последовательно разбираются: • чем Lakehouse отличается от Data Lake и Data Warehouse; • почему появились открытые табличные форматы (Iceberg, Delta Lake, Hudi); • ACID-транзакции, schema evolution, time travel и другие ключевые возможности современных платформ данных; • архитектурные принципы и практические сценарии применения Lakehouse. 📖 Читать перевод: https://datatalks.ru/lakehouse/ #DataEngineering #Lakehouse #ApacheIceberg #DeltaLake #DataArchitecture #BigData

Тестовый пример реализации MCP Server на Go для OpenCode ▫️Есть набор specs для написания через агентов с нуля MCP Server (те
Тестовый пример реализации MCP Server на Go для OpenCode ▫️Есть набор specs для написания через агентов с нуля MCP Server (теоретически можно реализоватьmcp для взаимодействия с любым ПО) ▫️Сгенерирована документация по разработке MCP Server (GitHub Pages) Сам бинарник возвращает из Яндекс метрики список счётчиков (был под рукой api). Основная цель - понять как реализовать свой mcp для взаимодействия с opencode, как собрать бинарник. 🔗 Исходный код, документация и готовые бинарники доступны в репозитории: https://github.com/ivanshamaev/mcp-server

Data Engineering AI Agent Skills - экспериментальный набор скиллов для агентной разработки и построения Agentic Data Platform
Data Engineering AI Agent Skills - экспериментальный набор скиллов для агентной разработки и построения Agentic Data Platform. https://datatalks.ru/de-ai-agent-skills/ Скиллы все в открытом доступе https://github.com/ivanshamaev/de-agent-skills

По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt
По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt

Volga: движок обработки real-time данных для AI/ML — аналог Spark и Flink на Rust (Arrow + DataFusion) / Хабр В статье описаны базовые сценарии работы, архитектурные особенности и переход движка на rust. https://habr.com/ru/articles/1021290/

Закончил проект по 2 модулю AI Agents — research-agent Репозиторий: https://github.com/ivanshamaev/research-agent Изначальная цель заключалась в том, чтобы на простом примере пройти весь цикл взаимодействия: как оркестратор общается с LLM, как агент выбирает инструменты, как возвращаются результаты вызовов, где хранится состояние и в какой момент всё это собирается в итоговый отчёт. В процессе реализации исходный описанный концепт во 2 модуле изменился. Плюс вместо 1-2 двух llm моделей добавились open-source варианты. И самое важное - добавил gatellm.ru, на котором и протестировался. В итоге получился CLI-агент, который: - ищет материалы по теме, - загружает и обрабатывает страницы, - суммаризирует найденное, - собирает результат в структурированный markdown-отчёт с источниками (здесь пока что бага, на днях доработаю). В проекте есть подробная документация со схемами. Для тех, кто хочет разобраться в том, как создать свой агент - welcome: - как выглядит ReAct-цикл на практике, - зачем нужен tool registry, - где проходит граница между orchestration и tools, - и т.д. Агент написан и отлажен за 1 час с помощью claude code (с учетом переделки части модулей и поиска api llm для тестов). 👉🏻 В репозитории есть docs, в которых разложена реализация.

Какая же жиза)
Какая же жиза)

🤖 opencode: Учимся создавать виртуальные команды из агентов для Data-проектов 🚀 Делюсь небольшой инструкцией по OpenCode — инструменту, который можно использовать не просто как CLI, а как полноценный слой настройки проекта для работы с агентами, ролями, правилами и workflow 👇 За основу я взял демо-пример, где OpenCode + ChatGPT использовались для создания проекта с аналитическим стеком. Сразу оговорюсь: в самом проекте не было четкой постановки задачи 🎯 Делал быстрые наброски, чтобы понять как настраивать opencode и какая у него структура. Что попало в инструкцию: ✨ как правильно оформить проект ✨ где и что писать ✨ как задавать правила для агента ✨ как подключать роли, skills и спецификации ✨ как сделать так, чтобы агент работал не “с нуля”, а в контексте вашей команды Что оказалось особенно ценным 💡 OpenCode становится по-настоящему полезным, когда воспринимаешь его не как “чатик в терминале”, а как часть инженерной инфраструктуры проекта. То есть важно не только запустить tool, но и продумать: 📌 AGENTS.md — как проектный контракт 📌 opencode.json — как control plane для правил, инструментов и разрешений 📌 .opencode/agents/ — для role-based subagents 📌 .opencode/skills/ — для повторяемых playbooks 📌 docs/specs/ — для устойчивых спецификаций, на которые может опираться агент В итоге получается интересный подход: можно собирать “виртуальную команду” из агентов под data-проект — например, выделять роли аналитика, архитектора, infra-инженера, а также задавать им понятные зоны ответственности 🧩 Мне кажется, это особенно полезно тем, кто хочет: — структурировать AI-работу в репозитории — выстроить понятные правила для агентов — сделать процесс воспроизводимым для команды — использовать AI не только для генерации кода, но и для организации инженерного процесса ⚙️📊

AI Agent Engineer Roadmap Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agent
AI Agent Engineer Roadmap Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agents. Исходная цель: быстро вникнуть в особенности и архитектуру решений для применения в работе. В целом уже что-то можно почитать и изучить. По проектам пока не уверен, что будет (и будет ли). https://datatalks.ru/ai-agents/

Привет 👋🏻 Документация airflow с github pages переехала на новый адрес https://datatalks.ru/airflow-docs/. А по Trino тоже
Привет 👋🏻 Документация airflow с github pages переехала на новый адрес https://datatalks.ru/airflow-docs/. А по Trino тоже появилась заготовка https://datatalks.ru/trino-docs/ (пока висит английская версия, чтобы без vpn смотреть)

Полное руководство по созданию Skills для Claude Перевод guide от Anthropic https://fkonovalov.github.io/claude-skills-guide-ru/

Запряг cursor перевести доку с сайта astronomer. Детально не читал, но вроде получилось хорошо. https://github.com/ivanshamaev/airflow-docs

GitHub Agentic Workflows are now in technical preview - GitHub Changelog GitHub выпустил прикольную фичу, которая по сути даёт вам суперсилу "DevOps" для работы с CI/CD. Теперь достаточно написать то, что вы хотите получить в формате Markdown, а агент сам сделает всю работу. https://github.blog/changelog/2026-02-13-github-agentic-workflows-are-now-in-technical-preview/

Подборка сайтов со скиллами для ИИ-агентов — можно научить своего бота абсолютно всему без исключения: • skills.sh • skillhub
Подборка сайтов со скиллами для ИИ-агентов — можно научить своего бота абсолютно всему без исключения: • skills.shskillhub.clubskillsmp.com Сохраняем.

🚀 Airflow: пример Mapped Tasks + Trigger DAG В Apache Airflow есть две фичи: 👉 Mapped Tasks - динамическое создание набора тасок с разными параметрами 👉 Trigger DAG - запуск одного DAG из другого с передачей параметров Я собрал небольшой demo-пример, который показывает, как эти механики можно использовать вместе. 1️⃣ Первый DAG — Orchestrator Реализованы Mapped Tasks. Каждая mapped-таска: ▫️ получает свой параметр ▫️ триггерит второй DAG Выполнение идёт последовательно (одна mapped-таска за другой). По сути — это контроллер, который запускает отдельный pipeline для каждого входного значения. 2️⃣ Второй DAG — Worker ▫️ Принимает параметр из первого DAG ▫️ Подставляет его в SQL-запрос ▫️ Выполняет запрос в PostgreSQL Также сгенерирована документация по этим двум дагам и есть минимум теории по этим двум темам (с оглядкой на эти два дага): 🔸 Airflow Mapped Tasks Tutorial 🔸Airflow Trigger Dag Tutorial 🔗 Ссылка на даги и доку: trigger_example ⏬⏬⏬ В репозитории также можно найти docker-compose.yml, для запуска этих примеров.

Data-команды должны стать командами контекста Context engineering = управление данными + инженерия данных + наука о данных. Понравилась статья, закинул перевод на сайт. На мой взгляд, content engineering может стать как отдельным ответвлением профессии (здесь и аналитика, и бизнес-процессы, более быстрое получение ответов на вопросы). С другой стороны дата команды могут трансформироваться в нечто большее. Всё зависит от ваших экспериментов и открытости к технологиям. Главное держать баланс хайпа и реальной пользой для бизнеса. https://datatalks.ru/context-engineering-data-teams/

ClickHouse выпустил agent-skills Agent Skills — это открытый стандарт для расширения возможностей ИИ-агентов с помощью модулей, которые дают им доменные знания, инструкции и повторяемые процедуры без необходимости дообучения модели. По сути это набор лучших практик работы с ClickHouse: как правильно проектировать схемы, оптимизировать запросы и настраивать загрузку данных. Далее эти skills подключаются в AI редактор, например, Copilot, Claude Code, Cursor. GitHub - ClickHouse/agent-skills: The official Agent Skills for ClickHouse and ClickHouse Cloud https://github.com/ClickHouse/agent-skills