Data Engineering / Инженерия данных / Data Engineer / DWH
前往频道在 Telegram
Data Engineering: ETL / DWH / Data Pipelines based on Open-Source software. Инженерия данных. ✔ DWH / SQL ✔ Airflow / Python / ETL / dbt / Spark ✔ AI Agents Рекламу не размещаю Вопросы: @iv_shamaev | datatalks.ru
显示更多2 689
订阅者
无数据24 小时
+27 天
+2130 天
数据加载中...
相似频道
标签云
进出提及
---
---
---
---
---
---
吸引订阅者
八月 '26
八月 '26
+45
在0个频道中
七月 '26
+39
在0个频道中
Get PRO
六月 '26
+45
在0个频道中
Get PRO
五月 '26
+69
在0个频道中
Get PRO
四月 '26
+59
在0个频道中
Get PRO
三月 '26
+75
在0个频道中
Get PRO
二月 '26
+143
在0个频道中
Get PRO
一月 '26
+72
在0个频道中
Get PRO
十二月 '25
+90
在0个频道中
Get PRO
十一月 '25
+109
在2个频道中
Get PRO
十月 '25
+86
在0个频道中
Get PRO
九月 '25
+122
在1个频道中
Get PRO
八月 '25
+123
在3个频道中
Get PRO
七月 '25
+101
在1个频道中
Get PRO
六月 '25
+87
在0个频道中
Get PRO
五月 '25
+80
在0个频道中
Get PRO
四月 '25
+85
在0个频道中
Get PRO
三月 '25
+108
在2个频道中
Get PRO
二月 '25
+420
在3个频道中
Get PRO
一月 '250
在1个频道中
Get PRO
十二月 '240
在1个频道中
Get PRO
十一月 '240
在1个频道中
Get PRO
十月 '240
在3个频道中
Get PRO
九月 '24
+73
在2个频道中
Get PRO
八月 '24
+257
在0个频道中
Get PRO
七月 '240
在0个频道中
Get PRO
六月 '240
在0个频道中
Get PRO
五月 '240
在0个频道中
Get PRO
四月 '240
在0个频道中
Get PRO
三月 '240
在0个频道中
Get PRO
二月 '24
+28
在0个频道中
Get PRO
一月 '24
+40
在0个频道中
Get PRO
十二月 '23
+45
在0个频道中
Get PRO
十一月 '23
+53
在0个频道中
Get PRO
十月 '23
+61
在0个频道中
Get PRO
九月 '23
+110
在0个频道中
Get PRO
八月 '23
+29
在0个频道中
Get PRO
七月 '23
+36
在0个频道中
Get PRO
六月 '23
+27
在0个频道中
Get PRO
五月 '23
+44
在0个频道中
Get PRO
四月 '23
+20
在0个频道中
Get PRO
三月 '23
+48
在0个频道中
Get PRO
二月 '23
+24
在0个频道中
Get PRO
一月 '23
+30
在0个频道中
Get PRO
十二月 '22
+25
在0个频道中
Get PRO
十一月 '22
+226
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 29 八月 | +1 | |||
| 28 八月 | +2 | |||
| 27 八月 | +1 | |||
| 26 八月 | 0 | |||
| 25 八月 | +1 | |||
| 24 八月 | +3 | |||
| 23 八月 | 0 | |||
| 22 八月 | +1 | |||
| 21 八月 | +3 | |||
| 20 八月 | +1 | |||
| 19 八月 | +6 | |||
| 18 八月 | 0 | |||
| 17 八月 | +1 | |||
| 16 八月 | +1 | |||
| 15 八月 | +1 | |||
| 14 八月 | +2 | |||
| 13 八月 | +1 | |||
| 12 八月 | +2 | |||
| 11 八月 | +1 | |||
| 10 八月 | +2 | |||
| 09 八月 | +1 | |||
| 08 八月 | +2 | |||
| 07 八月 | +1 | |||
| 06 八月 | +1 | |||
| 05 八月 | +3 | |||
| 04 八月 | +5 | |||
| 03 八月 | +1 | |||
| 02 八月 | 0 | |||
| 01 八月 | +1 |
频道帖子
🤖 Что такое SDD и зачем он нужен?
Spec-Driven Development (SDD) — подход к разработке, при котором сначала формируется подробная спецификация, а уже потом AI-агент реализует задачу.
Вместо:
«Напиши мне эту фичу» → код
получаем:
Требования → Specification → Plan → Tasks → Code → Tests
Зачем это нужно?
AI-агент умеет быстро писать код, но может неправильно понять задачу. Спецификация фиксирует что именно нужно сделать, ограничения, архитектуру и критерии готовности.
SDD превращает AI-кодинг из хаотичного *vibe coding* в управляемый инженерный процесс.
📚 Подробный разбор SDD и инструментов для работы с AI-агентами:
👉 https://datatalks.ru/spec-driven-development/index.html
#AI #AIAgents #SDD #SpecDrivenDevelopment #ClaudeCode #Codex #SoftwareEngineering
| 2 | 🆕 PySpark нейролекции
Возможно кому-то поможет в освоении PySpark. С одной стороны нейрослоп и повторы между лекциями, с другой стороны некоторые концепции хорошо прописаны.
Раздел с подготовкой к интервью собирался с разных сайтов и материалов.
https://datatalks.ru/pyspark/ | 1 254 |
| 3 | 🚀 Claude перевел книгу «The Fundamentals of Building a Lakehouse» на русский язык.
Если вы хотите разобраться, что такое Lakehouse, эта книга — отличная отправная точка. В ней последовательно разбираются:
• чем Lakehouse отличается от Data Lake и Data Warehouse;
• почему появились открытые табличные форматы (Iceberg, Delta Lake, Hudi);
• ACID-транзакции, schema evolution, time travel и другие ключевые возможности современных платформ данных;
• архитектурные принципы и практические сценарии применения Lakehouse.
📖 Читать перевод:
https://datatalks.ru/lakehouse/
#DataEngineering #Lakehouse #ApacheIceberg #DeltaLake #DataArchitecture #BigData | 2 230 |
| 4 | Тестовый пример реализации MCP Server на Go для OpenCode
▫️Есть набор specs для написания через агентов с нуля MCP Server (теоретически можно реализоватьmcp для взаимодействия с любым ПО)
▫️Сгенерирована документация по разработке MCP Server (GitHub Pages)
Сам бинарник возвращает из Яндекс метрики список счётчиков (был под рукой api). Основная цель - понять как реализовать свой mcp для взаимодействия с opencode, как собрать бинарник.
🔗 Исходный код, документация и готовые бинарники доступны в репозитории: https://github.com/ivanshamaev/mcp-server | 1 032 |
| 5 | Data Engineering AI Agent Skills - экспериментальный набор скиллов для агентной разработки и построения Agentic Data Platform.
https://datatalks.ru/de-ai-agent-skills/
Скиллы все в открытом доступе https://github.com/ivanshamaev/de-agent-skills | 1 763 |
| 6 | По Trino 479 документации https://datatalks.ru/trino-docs/ переведены все разделы + добавлена информация по dbt | 1 665 |
| 7 | Volga: движок обработки real-time данных для AI/ML — аналог Spark и Flink на Rust (Arrow + DataFusion) / Хабр
В статье описаны базовые сценарии работы, архитектурные особенности и переход движка на rust.
https://habr.com/ru/articles/1021290/ | 1 742 |
| 8 | Закончил проект по 2 модулю AI Agents — research-agent
Репозиторий: https://github.com/ivanshamaev/research-agent
Изначальная цель заключалась в том, чтобы на простом примере пройти весь цикл взаимодействия: как оркестратор общается с LLM, как агент выбирает инструменты, как возвращаются результаты вызовов, где хранится состояние и в какой момент всё это собирается в итоговый отчёт.
В процессе реализации исходный описанный концепт во 2 модуле изменился. Плюс вместо 1-2 двух llm моделей добавились open-source варианты. И самое важное - добавил gatellm.ru, на котором и протестировался.
В итоге получился CLI-агент, который:
- ищет материалы по теме,
- загружает и обрабатывает страницы,
- суммаризирует найденное,
- собирает результат в структурированный markdown-отчёт с источниками (здесь пока что бага, на днях доработаю).
В проекте есть подробная документация со схемами. Для тех, кто хочет разобраться в том, как создать свой агент - welcome:
- как выглядит ReAct-цикл на практике,
- зачем нужен tool registry,
- где проходит граница между orchestration и tools,
- и т.д.
Агент написан и отлажен за 1 час с помощью claude code (с учетом переделки части модулей и поиска api llm для тестов).
👉🏻 В репозитории есть docs, в которых разложена реализация. | 1 760 |
| 9 | Какая же жиза) | 1 573 |
| 10 | Trino Перевод DeepWiki
https://datatalks.ru/trino-deepwiki/ | 1 780 |
| 11 | 🤖 opencode: Учимся создавать виртуальные команды из агентов для Data-проектов 🚀
Делюсь небольшой инструкцией по OpenCode — инструменту, который можно использовать не просто как CLI, а как полноценный слой настройки проекта для работы с агентами, ролями, правилами и workflow 👇
За основу я взял демо-пример, где OpenCode + ChatGPT использовались для создания проекта с аналитическим стеком.
Сразу оговорюсь: в самом проекте не было четкой постановки задачи 🎯 Делал быстрые наброски, чтобы понять как настраивать opencode и какая у него структура.
Что попало в инструкцию:
✨ как правильно оформить проект
✨ где и что писать
✨ как задавать правила для агента
✨ как подключать роли, skills и спецификации
✨ как сделать так, чтобы агент работал не “с нуля”, а в контексте вашей команды
Что оказалось особенно ценным 💡
OpenCode становится по-настоящему полезным, когда воспринимаешь его не как “чатик в терминале”, а как часть инженерной инфраструктуры проекта.
То есть важно не только запустить tool, но и продумать:
📌 AGENTS.md — как проектный контракт
📌 opencode.json — как control plane для правил, инструментов и разрешений
📌 .opencode/agents/ — для role-based subagents
📌 .opencode/skills/ — для повторяемых playbooks
📌 docs/specs/ — для устойчивых спецификаций, на которые может опираться агент
В итоге получается интересный подход:
можно собирать “виртуальную команду” из агентов под data-проект — например, выделять роли аналитика, архитектора, infra-инженера, а также задавать им понятные зоны ответственности 🧩
Мне кажется, это особенно полезно тем, кто хочет:
— структурировать AI-работу в репозитории
— выстроить понятные правила для агентов
— сделать процесс воспроизводимым для команды
— использовать AI не только для генерации кода, но и для организации инженерного процесса ⚙️📊 | 1 933 |
| 12 | AI Agent Engineer Roadmap
Некоторое время назад начал накидывать через claude импровизационный roadmap по разработке ai agents. Исходная цель: быстро вникнуть в особенности и архитектуру решений для применения в работе. В целом уже что-то можно почитать и изучить.
По проектам пока не уверен, что будет (и будет ли).
https://datatalks.ru/ai-agents/ | 1 956 |
| 13 | Привет 👋🏻
Документация airflow с github pages переехала на новый адрес https://datatalks.ru/airflow-docs/.
А по Trino тоже появилась заготовка https://datatalks.ru/trino-docs/ (пока висит английская версия, чтобы без vpn смотреть) | 2 168 |
| 14 | Полное руководство по созданию Skills для Claude
Перевод guide от Anthropic
https://fkonovalov.github.io/claude-skills-guide-ru/ | 2 104 |
| 15 | Запряг cursor перевести доку с сайта astronomer. Детально не читал, но вроде получилось хорошо.
https://github.com/ivanshamaev/airflow-docs | 2 299 |
| 16 | GitHub Agentic Workflows are now in technical preview - GitHub Changelog
GitHub выпустил прикольную фичу, которая по сути даёт вам суперсилу "DevOps" для работы с CI/CD.
Теперь достаточно написать то, что вы хотите получить в формате Markdown, а агент сам сделает всю работу.
https://github.blog/changelog/2026-02-13-github-agentic-workflows-are-now-in-technical-preview/ | 2 004 |
| 17 | Подборка сайтов со скиллами для ИИ-агентов — можно научить своего бота абсолютно всему без исключения:
• skills.sh
• skillhub.club
• skillsmp.com
Сохраняем. | 1 587 |
| 18 | 🚀 Airflow: пример Mapped Tasks + Trigger DAG
В Apache Airflow есть две фичи:
👉 Mapped Tasks - динамическое создание набора тасок с разными параметрами
👉 Trigger DAG - запуск одного DAG из другого с передачей параметров
Я собрал небольшой demo-пример, который показывает, как эти механики можно использовать вместе.
1️⃣ Первый DAG — Orchestrator
Реализованы Mapped Tasks. Каждая mapped-таска:
▫️ получает свой параметр
▫️ триггерит второй DAG
Выполнение идёт последовательно (одна mapped-таска за другой). По сути — это контроллер, который запускает отдельный pipeline для каждого входного значения.
2️⃣ Второй DAG — Worker
▫️ Принимает параметр из первого DAG
▫️ Подставляет его в SQL-запрос
▫️ Выполняет запрос в PostgreSQL
Также сгенерирована документация по этим двум дагам и есть минимум теории по этим двум темам (с оглядкой на эти два дага):
🔸 Airflow Mapped Tasks Tutorial
🔸Airflow Trigger Dag Tutorial
🔗 Ссылка на даги и доку: trigger_example
⏬⏬⏬
В репозитории также можно найти docker-compose.yml, для запуска этих примеров. | 1 608 |
| 19 | Data-команды должны стать командами контекста
Context engineering = управление данными + инженерия данных + наука о данных.
Понравилась статья, закинул перевод на сайт. На мой взгляд, content engineering может стать как отдельным ответвлением профессии (здесь и аналитика, и бизнес-процессы, более быстрое получение ответов на вопросы). С другой стороны дата команды могут трансформироваться в нечто большее.
Всё зависит от ваших экспериментов и открытости к технологиям. Главное держать баланс хайпа и реальной пользой для бизнеса.
https://datatalks.ru/context-engineering-data-teams/ | 1 497 |
| 20 | ClickHouse выпустил agent-skills
Agent Skills — это открытый стандарт для расширения возможностей ИИ-агентов с помощью модулей, которые дают им доменные знания, инструкции и повторяемые процедуры без необходимости дообучения модели.
По сути это набор лучших практик работы с ClickHouse: как правильно проектировать схемы, оптимизировать запросы и настраивать загрузку данных. Далее эти skills подключаются в AI редактор, например, Copilot, Claude Code, Cursor.
GitHub - ClickHouse/agent-skills: The official Agent Skills for ClickHouse and ClickHouse Cloud
https://github.com/ClickHouse/agent-skills | 2 591 |
