Data Engineering / Инженерия данных / Data Engineer / DWH
前往频道在 Telegram
Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru
显示更多2 689
订阅者
无数据24 小时
+27 天
+2130 天
帖子存档
🤖 Что такое SDD и зачем он нужен?
Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подробная спецификация, а уже потом AI-агент реализует задачу.
Вместо:
«Напиши мне эту фичу» → код
получаем:
Требования → Specification → Plan → Tasks → Code → Tests
Зачем это нужно?
AI-агент умеет быстро писать код, но может неправильно понять задачу. Спецификация фиксирует что именно нужно сделать, ограничения, архитектуру и критерии готовности.
SDD превращает AI-кодинг из хаотичного *vibe coding* в управляемый инженерный процесс.
📚 Подробный разбор SDD и инструментов для работы с AI-агентами:
👉 https://datatalks.ru/spec-driven-development/index.html
#AI #AIAgents #SDD #SpecDrivenDevelopment #ClaudeCode #Codex #SoftwareEngineering
🆕 PySpark нейролекции
Возможно кому-то поможет в освоении PySpark. С одной стороны нейрослоп и повторы между лекциями, с другой стороны некоторые концепции хорошо прописаны.
Раздел с подготовкой к интервью собирался с разных сайтов и материалов.
https://datatalks.ru/pyspark/
🚀 Claude перевел книгу «The Fundamentals of Building a Lakehouse» на русский язык.
Если вы хотите разобраться, что такое Lakehouse, эта книга — отличная отправная точка. В ней последовательно разбираются:
• чем Lakehouse отличается от Data Lake и Data Warehouse;
• почему появились открытые табличные форматы (Iceberg, Delta Lake, Hudi);
• ACID-транзакции, schema evolution, time travel и другие ключевые возможности современных платформ данных;
• архитектурные принципы и практические сценарии применения Lakehouse.
📖 Читать перевод:
https://datatalks.ru/lakehouse/
#DataEngineering #Lakehouse #ApacheIceberg #DeltaLake #DataArchitecture #BigData
Тестовый пример реализации MCP Server на Go для OpenCode
▫️Есть набор specs для написания через агентов с нуля MCP Server (теоретически можно реализоватьmcp для взаимодействия с любым ПО)
▫️Сгенерирована документация по разработке MCP Server (GitHub Pages)
Сам бинарник возвращает из Яндекс метрики список счётчиков (был под рукой api). Основная цель - понять как реализовать свой mcp для взаимодействия с opencode, как собрать бинарник.
🔗 Исходный код, документация и готовые бинарники доступны в репозитории: https://github.com/ivanshamaev/mcp-server
Data Engineering AI Agent Skills - экспериментальный набор скиллов для агентной разработки и построения Agentic Data Platform.
https://datatalks.ru/de-ai-agent-skills/
Скиллы все в открытом доступе https://github.com/ivanshamaev/de-agent-skills
По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt
Volga: движок обработки real-time данных для AI/ML — аналог Spark и Flink на Rust (Arrow + DataFusion) / Хабр
В статье описаны базовые сценарии работы, архитектурные особенности и переход движка на rust.
https://habr.com/ru/articles/1021290/
Закончил проект по 2 модулю AI Agents — research-agent
Репозиторий: https://github.com/ivanshamaev/research-agent
Изначальная цель заключалась в том, чтобы на простом примере пройти весь цикл взаимодействия: как оркестратор общается с LLM, как агент выбирает инструменты, как возвращаются результаты вызовов, где хранится состояние и в какой момент всё это собирается в итоговый отчёт.
В процессе реализации исходный описанный концепт во 2 модуле изменился. Плюс вместо 1-2 двух llm моделей добавились open-source варианты. И самое важное - добавил gatellm.ru, на котором и протестировался.
В итоге получился CLI-агент, который:
- ищет материалы по теме,
- загружает и обрабатывает страницы,
- суммаризирует найденное,
- собирает результат в структурированный markdown-отчёт с источниками (здесь пока что бага, на днях доработаю).
В проекте есть подробная документация со схемами. Для тех, кто хочет разобраться в том, как создать свой агент - welcome:
- как выглядит ReAct-цикл на практике,
- зачем нужен tool registry,
- где проходит граница между orchestration и tools,
- и т.д.
Агент написан и отлажен за 1 час с помощью claude code (с учетом переделки части модулей и поиска api llm для тестов).
👉🏻 В репозитории есть docs, в которых разложена реализация.
Trino Перевод DeepWiki
https://datatalks.ru/trino-deepwiki/
🤖 opencode: Учимся создавать виртуальные команды из агентов для Data-проектов 🚀
Делюсь небольшой инструкцией по OpenCode — инструменту, который можно использовать не просто как CLI, а как полноценный слой настройки проекта для работы с агентами, ролями, правилами и workflow 👇
За основу я взял демо-пример, где OpenCode + ChatGPT использовались для создания проекта с аналитическим стеком.
Сразу оговорюсь: в самом проекте не было четкой постановки задачи 🎯 Делал быстрые наброски, чтобы понять как настраивать opencode и какая у него структура.
Что попало в инструкцию:
✨ как правильно оформить проект
✨ где и что писать
✨ как задавать правила для агента
✨ как подключать роли, skills и спецификации
✨ как сделать так, чтобы агент работал не “с нуля”, а в контексте вашей команды
Что оказалось особенно ценным 💡
OpenCode становится по-настоящему полезным, когда воспринимаешь его не как “чатик в терминале”, а как часть инженерной инфраструктуры проекта.
То есть важно не только запустить tool, но и продумать:
📌
AGENTS.md — как проектный контракт
📌 opencode.json — как control plane для правил, инструментов и разрешений
📌 .opencode/agents/ — для role-based subagents
📌 .opencode/skills/ — для повторяемых playbooks
📌 docs/specs/ — для устойчивых спецификаций, на которые может опираться агент
В итоге получается интересный подход:
можно собирать “виртуальную команду” из агентов под data-проект — например, выделять роли аналитика, архитектора, infra-инженера, а также задавать им понятные зоны ответственности 🧩
Мне кажется, это особенно полезно тем, кто хочет:
— структурировать AI-работу в репозитории
— выстроить понятные правила для агентов
— сделать процесс воспроизводимым для команды
— использовать AI не только для генерации кода, но и для организации инженерного процесса ⚙️📊AI Agent Engineer Roadmap
Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agents. Исходная цель: быстро вникнуть в особенности и архитектуру решений для применения в работе. В целом уже что-то можно почитать и изучить.
По проектам пока не уверен, что будет (и будет ли).
https://datatalks.ru/ai-agents/
Привет 👋🏻
Документация airflow с github pages переехала на новый адрес https://datatalks.ru/airflow-docs/.
А по Trino тоже появилась заготовка https://datatalks.ru/trino-docs/ (пока висит английская версия, чтобы без vpn смотреть)
Полное руководство по созданию Skills для Claude
Перевод guide от Anthropic
https://fkonovalov.github.io/claude-skills-guide-ru/
Запряг cursor перевести доку с сайта astronomer. Детально не читал, но вроде получилось хорошо.
https://github.com/ivanshamaev/airflow-docs
GitHub Agentic Workflows are now in technical preview - GitHub Changelog
GitHub выпустил прикольную фичу, которая по сути даёт вам суперсилу "DevOps" для работы с CI/CD.
Теперь достаточно написать то, что вы хотите получить в формате Markdown, а агент сам сделает всю работу.
https://github.blog/changelog/2026-02-13-github-agentic-workflows-are-now-in-technical-preview/
Repost from Басов про стартапы
Подборка сайтов со скиллами для ИИ-агентов — можно научить своего бота абсолютно всему без исключения:
• skills.sh
• skillhub.club
• skillsmp.com
Сохраняем.
🚀 Airflow: пример Mapped Tasks + Trigger DAG
В Apache Airflow есть две фичи:
👉 Mapped Tasks - динамическое создание набора тасок с разными параметрами
👉 Trigger DAG - запуск одного DAG из другого с передачей параметров
Я собрал небольшой demo-пример, который показывает, как эти механики можно использовать вместе.
1️⃣ Первый DAG — Orchestrator
Реализованы Mapped Tasks. Каждая mapped-таска:
▫️ получает свой параметр
▫️ триггерит второй DAG
Выполнение идёт последовательно (одна mapped-таска за другой). По сути — это контроллер, который запускает отдельный pipeline для каждого входного значения.
2️⃣ Второй DAG — Worker
▫️ Принимает параметр из первого DAG
▫️ Подставляет его в SQL-запрос
▫️ Выполняет запрос в PostgreSQL
Также сгенерирована документация по этим двум дагам и есть минимум теории по этим двум темам (с оглядкой на эти два дага):
🔸 Airflow Mapped Tasks Tutorial
🔸Airflow Trigger Dag Tutorial
🔗 Ссылка на даги и доку: trigger_example
⏬⏬⏬
В репозитории также можно найти
docker-compose.yml, для запуска этих примеров.Data-команды должны стать командами контекста
Context engineering = управление данными + инженерия данных + наука о данных.
Понравилась статья, закинул перевод на сайт. На мой взгляд, content engineering может стать как отдельным ответвлением профессии (здесь и аналитика, и бизнес-процессы, более быстрое получение ответов на вопросы). С другой стороны дата команды могут трансформироваться в нечто большее.
Всё зависит от ваших экспериментов и открытости к технологиям. Главное держать баланс хайпа и реальной пользой для бизнеса.
https://datatalks.ru/context-engineering-data-teams/
ClickHouse выпустил agent-skills
Agent Skills — это открытый стандарт для расширения возможностей ИИ-агентов с помощью модулей, которые дают им доменные знания, инструкции и повторяемые процедуры без необходимости дообучения модели.
По сути это набор лучших практик работы с ClickHouse: как правильно проектировать схемы, оптимизировать запросы и настраивать загрузку данных. Далее эти skills подключаются в AI редактор, например, Copilot, Claude Code, Cursor.
GitHub - ClickHouse/agent-skills: The official Agent Skills for ClickHouse and ClickHouse Cloud
https://github.com/ClickHouse/agent-skills
