Это разве аналитика?
رفتن به کانال در Telegram
Привет, я Андрей @ab0xa, bi / de / java dev Анализ данных и визуализация, интересные ссылки, вакансии, уроки, юмор) и личный опыт Стек технологий Python, Java, SQL, Tableau, Knime, Yandex.Облако, Yandex DataLens
نمایش بیشتر4 681
مشترکین
+124 ساعت
+127 روز
+1830 روز
در حال بارگیری داده...
کانالهای مشابه
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
ژوئیه '26
ژوئیه '26
+55
در 0 کانالها
ژوئن '26
+60
در 0 کانالها
Get PRO
مه '26
+46
در 0 کانالها
Get PRO
آوریل '26
+40
در 0 کانالها
Get PRO
مارس '26
+80
در 0 کانالها
Get PRO
فوریه '26
+93
در 1 کانالها
Get PRO
ژانویه '26
+99
در 1 کانالها
Get PRO
دسامبر '25
+77
در 0 کانالها
Get PRO
نوامبر '25
+68
در 3 کانالها
Get PRO
اکتبر '25
+101
در 3 کانالها
Get PRO
سپتامبر '25
+106
در 0 کانالها
Get PRO
اوت '25
+74
در 1 کانالها
Get PRO
ژوئیه '25
+162
در 1 کانالها
Get PRO
ژوئن '25
+68
در 1 کانالها
Get PRO
مه '25
+231
در 1 کانالها
Get PRO
آوریل '25
+80
در 0 کانالها
Get PRO
مارس '25
+311
در 1 کانالها
Get PRO
فوریه '25
+108
در 2 کانالها
Get PRO
ژانویه '25
+89
در 0 کانالها
Get PRO
دسامبر '24
+211
در 1 کانالها
Get PRO
نوامبر '24
+197
در 1 کانالها
Get PRO
اکتبر '24
+170
در 1 کانالها
Get PRO
سپتامبر '24
+312
در 0 کانالها
Get PRO
اوت '24
+154
در 0 کانالها
Get PRO
ژوئیه '24
+228
در 3 کانالها
Get PRO
ژوئن '24
+183
در 1 کانالها
Get PRO
مه '24
+193
در 2 کانالها
Get PRO
آوریل '24
+136
در 0 کانالها
Get PRO
مارس '24
+128
در 0 کانالها
Get PRO
فوریه '24
+130
در 0 کانالها
Get PRO
ژانویه '24
+130
در 0 کانالها
Get PRO
دسامبر '23
+124
در 0 کانالها
Get PRO
نوامبر '23
+57
در 1 کانالها
Get PRO
اکتبر '23
+49
در 0 کانالها
Get PRO
سپتامبر '23
+72
در 0 کانالها
Get PRO
اوت '23
+119
در 0 کانالها
Get PRO
ژوئیه '23
+216
در 0 کانالها
Get PRO
ژوئن '23
+179
در 0 کانالها
Get PRO
مه '23
+716
در 0 کانالها
Get PRO
آوریل '23
+58
در 0 کانالها
Get PRO
مارس '23
+50
در 0 کانالها
Get PRO
فوریه '23
+63
در 0 کانالها
Get PRO
ژانویه '23
+75
در 0 کانالها
Get PRO
دسامبر '22
+76
در 0 کانالها
Get PRO
نوامبر '22
+145
در 0 کانالها
Get PRO
اکتبر '22
+33
در 0 کانالها
Get PRO
سپتامبر '22
+43
در 0 کانالها
Get PRO
اوت '22
+153
در 0 کانالها
Get PRO
ژوئیه '22
+54
در 0 کانالها
Get PRO
ژوئن '22
+29
در 0 کانالها
Get PRO
مه '22
+22
در 0 کانالها
Get PRO
آوریل '22
+60
در 0 کانالها
Get PRO
مارس '22
+303
در 0 کانالها
Get PRO
فوریه '22
+30
در 0 کانالها
Get PRO
ژانویه '22
+29
در 0 کانالها
Get PRO
دسامبر '21
+49
در 0 کانالها
Get PRO
نوامبر '21
+67
در 0 کانالها
Get PRO
اکتبر '21
+396
در 0 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 31 ژوئیه | +1 | |||
| 30 ژوئیه | +3 | |||
| 29 ژوئیه | +1 | |||
| 28 ژوئیه | +5 | |||
| 27 ژوئیه | +5 | |||
| 26 ژوئیه | +1 | |||
| 25 ژوئیه | +2 | |||
| 24 ژوئیه | +2 | |||
| 23 ژوئیه | 0 | |||
| 22 ژوئیه | 0 | |||
| 21 ژوئیه | +1 | |||
| 20 ژوئیه | +1 | |||
| 19 ژوئیه | +4 | |||
| 18 ژوئیه | +2 | |||
| 17 ژوئیه | +1 | |||
| 16 ژوئیه | 0 | |||
| 15 ژوئیه | +1 | |||
| 14 ژوئیه | +4 | |||
| 13 ژوئیه | 0 | |||
| 12 ژوئیه | 0 | |||
| 11 ژوئیه | +3 | |||
| 10 ژوئیه | +3 | |||
| 09 ژوئیه | +2 | |||
| 08 ژوئیه | +1 | |||
| 07 ژوئیه | 0 | |||
| 06 ژوئیه | +3 | |||
| 05 ژوئیه | +2 | |||
| 04 ژوئیه | +1 | |||
| 03 ژوئیه | +2 | |||
| 02 ژوئیه | +3 | |||
| 01 ژوئیه | +1 |
پستهای کانال
📊 Глубокое погружение в профессиональные инструменты на реальных проектах. Записывайтесь на курс «Системный аналитик. Экспертный уровень».
🎁 Учавствуйте в 3 бесплатных вебинарах — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!
6 августа, 20:00 мск — «Пользовательские сценарии (Use Cases) на реальном примере»: от бизнес-требования до задачи разработчику. Анализ требований, создание Use Cases, связь с разработкой, Q&A.
13 августа, 20:00 мск — «Управление данными в MSA»: цена ошибок дублирования данных, оптимизация инфраструктуры и выбор БД (SQL vs NoSQL), единый глоссарий и контракты данных без бюрократии, требования к качеству данных для ИИ, чтобы модели не «галлюцинировали».
20 августа, 20:00 мск — «Аналитическая дженга»: как проектировать и управлять изменениями системы через BACCM, (4+1) и C4, чтобы архитектура не рассыпалась.
Записывайтесь https://clck.ru/3UzbGN
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru, erid 2VtzqxhzotN
| 2 | Где-то рядом с культом железки у нас живет культ героя.
Давайте представим 2 команды.
Команда А. 1-2 года делала качественный продукт. Он просто выкатывается в любого заказчика, без проблем интегрируется со всем что надо и дальше работает без косяков.
Команда Хэ. Сделала нечто, оно развалилось у заказчика в первый же день. И следующую неделю все Хэ не спали, не ели, а правили баги и решали все на свете проблемы на этапе деливери.
Какая из команд будет на хорошем счету у директоров? Кого похвалят на корпоративе? Кому дадут ресурсов на следующем этапе?
Прости, товарищ Генри Форд, но эффективность у нас не в почете, у нас в почете героизм вопреки всему. Особенно вопреки собственному многолетнему раздолбайству. | 469 |
| 3 | بدون متن... | 492 |
| 4 | Ребят, тут Авито регистрацию на свой первый CTF открыл с призами до 300 000 рублей на команду 📍
AvitoTech устраивает CTF онлайн с денежным призовым фондом, мерчем и интересными тасками!
Регистрация команд уже открыта по ссылке, а ниже собрали инфу, что предстоит делать во время HoneyBadger CTF AvitoTech.
Возьмите на себя роль медоеда, проверьте защиту пчелиного улья и найдите все скрытые уязвимости в сотах.
Чего ждать от турнира: тасков на веб-уязвимости, инфраструктурных мисконфигов, анализа скомпилированного кода, расследования инцидентов, слабостей шифров, всего, что требует хакерской смекалки. И розыгрыша мерча, помимо основного призового фонда.
Важно: CTF не только для спецов по кибербезопасности — есть отдельная лига для всех, кто любит разбираться, как устроены IT-системы 🐝 | 564 |
| 5 | Внутри питона есть ЕЩЕ виртуальные машины
Мы все знаем, что сам питон - одна большая стековая виртуальная машина, которая выполняет опкоды. Их мы можем посмотреть через dis:
>>> import dis
>>> dis.dis('x + y')
0 RESUME 0
1 LOAD_NAME 0 (x)
LOAD_NAME 1 (y)
BINARY_OP 0 (+)
RETURN_VALUE
Можем получить список всех опкодов, можем вызвать их оптимизации и посмотреть на результат с оптимизациями.
Но! Внутри CPython есть и другие виртуальные машины. Сегодня поговорим про ту, которой все мы всегда пользовались, но не знали, что она - виртуальная машина.
pickle
Да, не удивляйтесь. Встроенный протокол сериализации в питоне работает благодаря отдельной стековой виртуальной машине. Давайте посмотрим.
>>> class User:
... def __init__(self, username: str, tags: list[str]) -> None:
... self.username = username
... self.tags = tags
... def __reduce__(self) -> tuple[type['User'], tuple[Any, ...]]:
... return (type(self), (self.username, self.tags))
Создадим обычный класс и запиклим его объект:
>>> import pickle
>>> user = User('sobolevn', tags=['python', 'tg'])
>>> pickle.dumps(user, protocol=0)
b'c__main__\nUser\np0\n(Vsobolevn\np1\n(lp2\nVpython\np3\naVtg\np4\natp5\nRp6\n.'
Обратите внимание, что в разных протоколах значение будет разное:
>>> pickle.dumps(user, protocol=1)
b'c__main__\nUser\nq\x00(X\x08\x00\x00\x00sobolevnq\x01]q\x02(X\x06\x00\x00\x00pythonq\x03X\x02\x00\x00\x00tgq\x04etq\x05Rq\x06.'
Всегда необходимо тестировать, что pickle работает для всех версий от 0 до pickle.HIGHEST_PROTOCOL для ваших объектов, которые поддерживают такой способ сериализации.
Что внутри?
Можно, глядя на значения, подумать, что там просто лежит какой-то бинарный формат сериалиации. Однако, там лежат опкоды виртуальной машины для сериалиации объектов. Их можно задисить:
>>> import pickletools
>>> pickletools.dis(pickle.dumps(user, protocol=1))
0: c GLOBAL '__main__ User'
15: q BINPUT 0
17: ( MARK
18: X BINUNICODE 'sobolevn'
31: q BINPUT 1
33: ] EMPTY_LIST
34: q BINPUT 2
36: ( MARK
37: X BINUNICODE 'python'
48: q BINPUT 3
50: X BINUNICODE 'tg'
57: q BINPUT 4
59: e APPENDS (MARK at 36)
60: t TUPLE (MARK at 17)
61: q BINPUT 5
63: R REDUCE
64: q BINPUT 6
66: . STOP
highest protocol among opcodes = 1
Сравните, как будет отличаться вывод для другого протокола, например пятого.
И окажется, что все "случайные" символы на самом деле просто так же обозначают опкоды. Теперь мы умеем их читать.
Мы можем найти все опкоды и посмотреть их доки:
>>> pickletools.opcodes[25].code
']'
>>> pickletools.opcodes[25].doc
'Push an empty list.'
И мы даже можем оптимизировать байткод pickle для более быстрой сериализации / десериализации.
Прям полностью настоящая ВМ :)
Вот за счет чего мы можем с помощью pickle сериализовать любой Python объект (почти), а с помощью других средств - получается сильно сложнее.
Обсуждение: Знали о такой детали реализации? Знаете ли вы как работает pickle сам по себе? Зачем нужны протоколы и версии? Или сделать отдельный пост про детали работы? Знаете ли вы, что pickle - фундаментально небезопасный протокол? И нельзя запускать чужие дампы, только свои доверенные?
Загадка: кстати, какие еще виртуальные машины внутри CPython вы знаете? Я назвал только одну из нескольких. Заходите в комменты за ответами, правильные - покажу завтра. | 465 |
| 6 | Присаживайся на диван к аналитикам Авито 👀
Команда AvitoTech запустила проект «Диванная аналитика». Это серия материалов, где специалисты из Авито рассказывают, как принимают решения в одной из крупнейших экосистем страны.
Если ты работаешь с данными, то вот 3 причины зайти на лендинг прямо сейчас:
1️⃣ Все выпуски опираются на реальный опыт — аналитики рассказывают о том, что уже применили у себя и что сработало.
2️⃣ Царит приятная атмосфера: по сути, все видео — это недушные мини-лекции с наглядной презентацией.
3️⃣ Разбираются разные темы — от ML до стратегического планирования.
Контент может пригодиться опытным аналитикам и менеджерам, которым надо говорить с командой на одном языке.
Смотри готовые выпуски и подпишись на новые — телеграм-бот пришлёт уведомление о новом видео!
Посмотреть, что там интересного | 688 |
| 7 | DBX
Так ли уж много надо для счастья на сегодняшний день? Полный бак бензина, хороший велик и... Чтобы хоть одна sql-ide показывала миллисекунды для datetime колонок в StarRocks!
Я очень люблю сообщества и неформальное общение. Там порой случайно можно узнать что-то интересное, способное поменять твои привычки в работе и сделать картинку вокруг чуточку лучше.
И вот недавно думали тряхнуть стариной и провести новый DBT митап с Алмазом, и он случайно обронил в разговоре dbx. Выглядит интересно, пошел смотреть что это такое.
Да, вся IDE поместилась в 15 мегабайт с поддержкой почти всех бд, которые сейчас есть на рынке. Но эти 15 мегабайт, конечно же, не включают в себя JDBC драйвера для вертики или хайва, например. А вот StarRocks включен в поставку по умолчанию. И то, с чем не справились ни JB с их убер зоопарком, ни DBeaver с аналогом - вот на скриншоте сверху.
А еще в DBX на маке работает cmd+enter для выполнения запросов, что благополучно сломали уже год как в DBeaver.
А еще там есть MCP для всех ваших коннектов и готовое how-to интеграция с курсором и клодом (и остальными). Который впрочем не работает на маках с арм :)
И еще рендеринг тупит и если быстро листать виртуальные столы - то видишь белый экран примерно пару секунд после перехода.
Но ладно, за миллисекунды и хоткеи все можно простить. Теперь это мой топчик. Спасибо, Алмаз :) | 701 |
| 8 | Генерируем Rust код из Python и становимся крабами
Проект "острый краб": https://github.com/kushaldas/spicycrab
Вы же знаете, что вы узнаете про все важные штуки в питоне первыми? На ближайшем Language Summit в июле Кушал Дас - core-разработчик CPython - представит свой новый проект. Но зачем ждать июля, когда код открыт? Давайте смотреть и пробовать!
В чем главная идея?
- Пишем на типизированном Python
- Получаем на выходе Rust код, который работает в десятки или сотни раз быстрее
- Можем использовать в Python крейты Rust и Python пакеты, что? 🙀
(проект еще не просто в альфе, а в пре-альфе, но мы тут просто любим странное, ставь 🕊, если просто заходишь сюда почитать про непонятное и удивительное)
Начнем с простого: print('Hello world')
Запустим: crabpy transpile ex.py и получим:
fn main() {
println!("Hello world");
}
Прикол! Давайте сделаем сложнее. Возьмем clap (популярная библиотека для парсинга CLI параметров в расте) и сделаем мини CLI с ее помощью ... на питоне.
1. Скачиваем Rust зависимость и генерим из нее Python стабы: cookcrab generate clap -o rust-stubs/
2. Смотрим, что там внутри правда Python стабы, удивляемся
3. Устанавливаем стабы: pip install -e ./rust-stubs/clap_builder ./rust-stubs/clap
4. Пишем на питоне:
from spicycrab_clap import Command, Arg, ArgMatches
def main() -> None:
matches: ArgMatches = (
Command.new("myapp")
.arg(Arg.new("name").required(True))
.get_matches()
)
name: str = matches.get_one("name").unwrap().clone()
print(f"Hello, {name}!")
5. Транспилим: crabpy transpile ex.py
6. Получаем
pub fn main() {
let matches: clap_builder::ArgMatches = clap::Command::new("myapp")
.arg(clap::Arg::new("name").required(true))
.get_matches();
let name: String = matches.get_one::<String>("name").cloned().unwrap().to_string();
println!("{}", format!("Hello, {}!", name));
}
7. Запускаем:
» cargo run -- Nikita
Finished `dev` profile [unoptimized + debuginfo] target(s) in 0.01s
Running `/Users/sobolev/Desktop/spicycrab/rusty/target/debug/ex Nikita`
Hello, Nikita!
Теперь у вас нет уважительных причин, чтобы говорить "я не знаю раст" 🌚️️
Зачем?
А если серьезно, то не совсем пока понятно - какую нишу будет занимать данный проект.
Сам автор говорит:
> Write typed Python and generate working Rust code via spicycrab. This currently includes part of stdlib, async (via tokio), actix-web examples. Slowly more and more Rust crates are available as stub typed Python modules, which we can use like normal Python code while developing and then compiling the generated Rust code as final output. The final goal is to be able to write smaller production code using spicycrab.
Кажется, что ниша довольно маленькая. Если вам реально хочется писать Python + Rust код вместе (что вообще-то лютейшая база, например ruff и uv ровно так и написаны), то есть уже готовые проекты:
- https://github.com/pyo3/pyo3 - для использования Rust вместе с CPython биндингами
- https://github.com/pyo3/maturin - система сборки для такие проектов
Есть проекты чуть менее универсальные, например:
- https://github.com/RustPython/RustPython - интерпретатор Python на Rust, там тоже можно писать модули на расте для питона своим особым способом
use rustpython::vm::pymodule;
#[pymodule]
mod test_module {
#[pyfunction]
pub fn add(a: i32, b: i32) -> i32 {
a + b
}
}
- https://github.com/youknowone/pyre - новый интерпретатор Python на Rust (от того же автора) но с Free-Threading и JIT из PyPy, в некоторых случаях в 45 раз быстрее CPython, goes brrrr
- Поддержка Rust напрямую в CPython: https://t.me/opensource_findings/941 Ждете? :)
И еще куча всего другого.
Но, будет интересно посмотреть, что выйдет из такого довольно необычного опыта.
Обсуждение: Знаете ли вы раст? Хотите ли изучить? Видите ли применения у себя на работе?
| Поддержать | YouTube | GitHub | Чат | | 634 |
| 9 | 😂😂😂😂😂 | 613 |
| 10 | ИИшные будни и полный пятничный сумбур
Сегодня подводили итоги квартала и все команды дата офиса сейчас пишут контекст для своих помощников. И вот нонсенс - чем лучше ваша слоенная архитектура и чем больше у нее документации, тем сложнее ее запихать в RAG и тем хуже на ней работают модели. Спасибо умным людям (привет, Венера), которые начали подробно описывать метрики в компании в маркдауне в репке dbt еще в 22 году - это самый простой и потрясающий буст по контексту для простых потребителей. Но вернемся к тому, почему вроде работали,а получилась шляпа. Самый простой способ убедиться в этом без построениях всяких специальных рагов - поставить nao.
Кто не слышал про эту штуку (как я, например, и спасибо большое просвещающим коллегам) - это по сути самая простая обертка для агента, нацеленная на работу с dwh. С одной стороны вы подключаете любую модель (Claude, ChatGPT, локальные модели), с другой стороны у вас веб чат с аутентификацией и авторизацией, а посередине репа с текстовыми файлами контекста. На первом запуске, когда мы подключили локальную модельку я был в диком восторге - ответ получил за секунды и вроде похож на верный. Правда на следующий день мы выяснили, что он был полностью выдуманным и ни один запрос в бд не был сделан :) Но в общем и целом после тюнинга получается достаточно удобно.
Так вот, в эту репку можно прямо ссылкой отгрузить dbt проект. Плюс еще сам nao собирает мету со всех подключенных бд на этапе init. И потом с этой горой информационного мусоры мы пытаемся взлететь, а размер контекста у локальных моделей сильно отстает от лидеров рынка - будет сплошной мусор.
Решить этой штукой мне хотелось вечную боль команд данных - выгрузки. И все бы ничего, но в коробке такого функционала нет :) Отвечать на вопросы с цифрами может, графики рисовать умеет, но csv выплюнуть - не сделали. У нас в планах на следующий квартал реализовать и пушнуть в апстрим. Еще коллега впрягся и добавил туда поддержку StarRocks :)
А что по остальным командам? BI и их ужасные системы из большой тройки. Самая большая проблема там - найти интересующую тебя информацию. Даже если приложение имеет описание, надо его еще найти, посмотреть есть ли там нужные разрезы и метрики. Решение - RAG. Чуете чем пахнет? Дата говернансом, дада, тем самым. Когда-то внедряли каталоги данных за миллион денег, которые сами по себе не могут решить никаких проблем. Так вот описание нужно, а каталоги - нет. И сам по себе офис данных сейчас по сути становится держателем контекста информации всей компании, мне так кажется. | 693 |
| 11 | AI-эра тех собесов
💻 Теперь вместе с sql/python-задачками на тех собесе могут дать создание мини-проекта за 20 минут
Разрешается использовать все, что угодно, любые ллм. (Только подумайте над тем, что будет работать, когда вы на созвоне на внутренней платформе.) Есть только одно условие — шерить экран
Примеры заданий
➡️Для де: написать ddl таблиц, sql-запросы по сборке витрин, несколько дагов
➡️Для разраба: придумать архитектуру микросервиса и реализовать его
➡️Разобраться в коде и найти баги
Сгенерили, а дальше?
🙂 Интервьюеры могут сами пока не до конца понимать, что делать после генерации кода) Они просто сидят и смотрят, как ты будешь разбираться, что происходит, просят внести правки или объяснить кусок кода
Пока такое замечено в WB в последние 2 месяца, но могут подтянуться и остальные. Особенно после этого поста😁
@data_engineerette | 597 |
| 12 | Лето — время начать: освойте Data Science на выгодных условиях
Хотите не просто теоретически разбираться в устройстве нейросетей, а уметь создавать их самостоятельно? Центр непрерывного образования ФКН НИУ ВШЭ предлагает присоединиться к структурированному и выстроенному практикующими экспертами обучению науке о данных.
Станьте специалистом по Data Science высокого уровня:
🟣первая программа профессиональной переподготовки, получившая аккредитацию Альянса в сфере искусственного интеллекта;
🟣вы пройдете весь путь: от высшей математики и программирования до нейросетей и работы с большими данными.
Программа включает курсы по ключевым дисциплинам:
🟣Математика для анализа данных;
🟣Алгоритмы и структуры данных;
🟣Программирование и автоматизация;
🟣Прикладная статистика для машинного обучения;
🟣Машинное и глубинное обучение.
Специальное предложение для тех, кто запишется на ближайший запуск:
⭐️ Скидка 10% на обучение
⭐️ Курс по BI в подарок
📁Старт: 30 июня.
Подробнее о программе 📍 | 588 |
| 13 | 😂😂😂😂 | 694 |
| 14 | Тренд на отказ от ETL провозглашенный датабриксом реален.
Реальностью его сделали 2 вещи
1) Появление лейка с упрощенной транзакционной моделью, квази-acid. В первую очередь это Iceberg и похожие на него технологии.
2) Распространение агентов.
И внезапно выяснилось, что под 98% микросервисов вполне можно подложить стораж с ограниченной транзакционной машиной. И нагрузки там большой не будет - ну 5, ну 50 tps - это уже вполне в зоне, где тот же s3 стораж справится. С некоторым кешем, разумеется.
С другой стороны - возможность подключить агента напрямую к данным (именно к данным, а не к самому сервису) это ценно. Потому что агент может сам обходить данные нескольких сервисов, взаимно обогащать их по своему усмотрению без того, чтобы разработчики сервисов делали ему отдельные ручки и оборачивали их в MCP.
Уходит важнейшее узкое место любых агентных историй.
Поэтому да, в транзакциях мало ценности, а в лайв-подключении агентов - много.
Нас ждет LTAP. | 677 |
| 15 | Databricks объявил конец эпохи пайплайнов.
На Data + AI Summit 2026 компания представила новую архитектуру LTAP (Lake Transactional/Analytical Processing), которая должна объединить транзакционные системы, аналитику, стриминг и AI на одной копии данных. Идея радикальная: приложения, BI-системы и AI-агенты работают с одним источником данных напрямую, без CDC, ETL и бесконечных репликаций между OLTP и аналитическими хранилищами.
Последние двадцать лет типичная архитектура выглядела примерно так:
PostgreSQL → CDC → Kafka → ETL → Data Warehouse → BI → AI
Каждый новый слой добавлял задержки, повышал стоимость владения и создавал новые точки отказа. Особенно болезненно это стало с появлением AI-агентов, которым нужны актуальные данные в реальном времени, а не копия пятиминутной давности.
Ответ Databricks — хранить операционные и аналитические данные в одном месте. В основе подхода лежит Lakebase, PostgreSQL-совместимая система, работающая поверх объектного хранилища и интегрированная с Lakehouse. Компания называет это первым LTAP-подходом, который должен заменить как традиционные ETL-процессы, так и многочисленные реплики баз данных.
Конечно, заявления о «смерти пайплайнов» стоит воспринимать осторожно. Интеграции между компаниями, обмен данными с внешними системами, специализированные стриминговые сценарии и гибридные архитектуры никуда не денутся.
Но сам тренд выглядит очень интересным. Если раньше индустрия спорила, что лучше — Data Lake или Data Warehouse, то теперь главный вопрос звучит иначе:
Нужно ли вообще перемещать данные между системами, если все сервисы, аналитика и AI могут работать поверх одной копии данных?
Похоже, именно вокруг этого вопроса и будет строиться следующая большая битва в мире Data Engineering.
@tldr_data | 574 |
| 16 | 🧑🎓 Стипендия Mediascope — отзывы и советы победителей прошлых лет
Уже девятый год мы проводим конкурс на стипендиальную программу Mediascope имени Владимира Гродского.
Мы попросили стипендиатов прошлых лет поделиться своими впечатлениями от программы: как они прошли отбор, на что потратили стипендию и что посоветуют будущим участникам. Ответы ребят — в наших карточках 😉
🗓 И хорошие новости — мы продлили дедлайн приема заявок на участие в программе в следующем учебном году! Ждем ваши заявки до 26 июня!
🩷 Mediascope | 777 |
| 17 | Всем привет
Так как в максе появилась возможность делать публичные каналы почти всем сделал такой канал
https://max.ru/se13369262_biz
Старый канал в максе оставляю, но новые посты в максе будут уже только в новом канале
https://max.ru/se13369262_biz
Подписывайтесь)
Телеграм канал также продолжу вести | 539 |
| 18 | Уважаемые коллеги, я понимаю, что сейчас не до постов про аналитику и ai-агентов, так как за окном лето, отдых и думскроллинг, но у меня есть важная тема, которую нам стоит обсудить!
Так, ну и что там такого важного?
Ну, вы задумывались, какие навыки и задачи в вашей корпоративной роли аналитика станут дороже, а какие обесценятся с постепенным переходом на агентские фреймворки? Тут об этом целая статья хайпится Some Simple Economics of AGI, и я бы хотел разобрать график оттуда
По горизонтали отложена стоимость автоматизации задачи (c_A), по вертикали стоимость проверки результата задачи человеком (c_H). Две пунктирные линии режут картинку на четыре части, горизонтальная это бюджет на проверку (B), вертикальная это зарплата (w), ниже которой держать работягу на задаче дороже, чем ее автоматизировать (логично)
Итого имеем 4 квадранта
Q1 (нижний левый) — автоматизация дешёвая, проверка дешёвая. Сюда падают всякие дашборды, регулярные выгрузки, базовые ETL, расчёт A/B через готовый калькулятор (когда дизайн уже задан), ad-hoc запросы под звонок. В расчётах авторов в этом квадранте лежит s_v ≈ 0.59 всей работы (s_v это доля задач, у которых обе стоимости дешёвые одновременно), и именно эту долю агенты автоматизируют первой
Q2 (верхний левый) — автоматизация дешёвая, проверка дорогая. В этот скоуп задач можно отнести оценки causal effect, дизайн рекомендательных систем, агентные пайплайны принятия решений, долгосрочные A/B с метрикой через квартал (изменение subscription pricing, retention 12M, ранкер ленты), оценка incrementality от brand-маркетинга
Формула c_H = w · t_fb / S_nm объясняет, почему здесь бывает жить: t_fb — сколько надо ждать результата, w зарплата эксперта, который проверяет, S_nm запас экспертизы в экономике. Длинный лаг умножается на дорогого эксперта, а делится на тающий запас экспертов. В пределе проверять некому, агенты летают без надзора
Q3 (нижний правый) — автоматизация дорогая, проверка дешёвая. Качественный user research и интервью с пользователями, ручной разбор отзывов и NPS с пониманием контекста, конкурентный анализ, подготовка слайдов для C-level с правильным месседжингом, разметка эджевых кейсов в данных. Зона временно живая, пока стрелка K_C на графике (рост компьюта) не сдвинет её содержимое влево, в Q1, и LLM в разбор отзывов и в классификацию уже зашли
Q4 (верхний правый) — автоматизация дорогая, проверка дорогая. Дизайн самой системы измерения продукта, то есть что считать North Star, перевод мутного запроса от CEO «надо увеличить engagement» в конкретные гипотезы и план измерений, дизайн экспериментальной программы на год с выбором guardrail-метрик, стратегические решения о приоритизации продуктовых направлений на данных плюс контексте, который нигде не записан
Погоди, а в чем тут новость? С джунами также ведь! Это база!
В целом я тоже так думал — замените агентов на джунов и суть же не изменится: джун делает Q1, мидл Q2, сеньор Q4, это карьерная лестница из любого учебника, какая там новизна вообще? Но есть три места, где аналогия агенты = джуны ломается, и из-за них статью, собственно, и написали:
1️⃣Verification не масштабируется, а execution масштабируется
Один сеньор мог проверять пару джунов в день, и количество джунов было ограничено физикой найма. Сегодня сеньор должен проверять выход агента, который генерирует в тысячи раз больше за тот же час. Execution капасити экспоненциальная, verify капасити линейная, упирается в одного человека. С джунами этой асимметрии не было, потому что джун тоже ограничен временем
2️⃣Codifier's curse
С джунами было так: сеньор обучает джуна, наращивает свой статус (становится ментором), джун через 5 лет становится мидлом, рынок экспертизы расширяется. С агентами: сеньор обучает модель, перекладывает свою интуицию в обучающие данные, и его собственная ценность падает. Аналога в карьерной лестнице нет, механизм работает в обратную сторону | 613 |
| 19 | Я довольно давно слежу за конференцией SmartData, и каждый раз нахожу для себя что-то новое.
В прошлом году были очень интересные доклады по StarRocks, новому модному убийце кликхауса в озёрах данных. Теперь не только кликхаус не тормозит) Также запомнился круглый стол про смерть хадупа и его новую жизнь...
В этом году, судя по анонсу, будет не менее интересно.
Конференция пройдет 23–24 сентября в Москве (отель «Холидей Инн Сокольники») и онлайн. Главная тема — «Data + AI: от источника данных до работающих моделей». По сути, это взгляд на полный цикл работы с данными, а не только на отдельные куски.
Заявлено несколько десятков докладов по практическим темам:
· обработка данных и стриминг
· СУБД и хранение данных (и MPP, и специализированные решения)
· архитектура платформ данных и MLOps
· Data Management и DataOps
· облачные решения
Для меня плюс в том, что организаторы делают акцент на техническом содержании. Нетехнических докладов мало — это скорее концентрат инженерного опыта.
Всего заявлено 50 спикеров, и, судя по прошлым годам, это люди, которые реально работают с большими данными в индустрии.
Ожидается больше 500 участников. Конференцию проводит команда, у которой за плечами уже более 140 профильных ивентов — это добавляет уверенности в организации.
Помимо самих докладов, ценно то, что можно пообщаться со спикерами после выступлений — в офлайне это работает лучше, чем онлайн. Еще будет афтепати, но это уже не про деловую часть, а про нормальное живое общение с коллегами.
Важный технический момент: все выступления записывают в 4K — это мелочь, но когда изучаешь сложные слайды с кодом или схемами, качество видео реально помогает.
Мне кажется, конференция будет полезна разработчикам бэкенда, дата-инженерам, аналитикам и тем, кто занимается ML. Если вы работаете с данными на серьезном уровне — стоит посмотреть программу.
Детали, билеты и записи докладов прошлых лет — уже на официальном сайте. Для подписчиков моего канала есть возможность приобрести билет со скидкой 15% по промокоду: EtoAnalytica
Я, надеюсь, буду в офлайне. Если решите приехать — буду рад пересечься. | 638 |
| 20 | Опытные продуктовые аналитики, Т-Банк ждет вас
4—5 июля будет Weekend Offer для продуктовых аналитиков. Все этапы проходят в онлайне:
— встреча с командой;
— техническая секция;
— фит-интервью.
Успешно пройдете собеседование за выходные — и оффер в Т-Банк ваш.
Последний день приема тестовых заданий — 30 июня. Оставить заявку можно на сайте | 609 |
