topdatalab
Открыть в Telegram
Канал поддержки книги «Как монетизировать данные». Работаю над corpsignals.com
Больше1 369
Подписчики
-124 часа
+27 дней
+2130 день
Архив постов
1 369
У меня сейчас лично паттерн фейковых резюме такой:
1) из Польши
2) почта аутлук
3) ссылка на linkedin нерабочая, хотя по форматы правильная. Возможно аккаунт был забанен
1 369
Вчера собеседовал читера!
Пригласил посмотрев на резюме, хотя позже понял, что все последнее место работы расписано исключительно под нашу вакансию. Скорее всего фейк.
Смотрю написано про dbt, спрашиваю, что с ним делал, ответ - ничего.
Вижу Duckdb, спрашиваю, чем отличается отSQLlitе, отвечает, внимательно читая с экрана. Похоже на AI помощника. Решил крякнуть его GPT, спросил важный вопрос про duckdb, ответил неправильно.
спросил его, уверен ли он в своем ответе, он почитал на экране, сказал, что да.
Что там, много таких помощников развелось? 🙂 Может просить глаза закрывать?
Слышал, что еще дипфеки появились для собесов.
1 369
Ребята, а кто-нибудь эксперементировал с локальными LLM моделями для разработки?
Интересует использование их в паре с мощными моделями (Codex, claude), где простые задачи отдаются локальной модели
1 369
Если вы собеседуетесь сейчас, дам маленький совет.
Учите продвинутую AI разработку в Claude/Codex!
И не просто учите, а используйте (планы, скиллы, память, тесты как минимум).
Поверьте, это вам сейчас пригодится на AI кодинг интервью.
Код руками уж мало кто пишет и требует этого
1 369
https://www.docker.com/products/docker-sandboxes/
для изоляции кодинг агентов, чтобы как минимум не дать агенту запустить "rm -rf /" :)
Я знаю, что для этого еще используют nixos, но похоже новый вариант от docker проще
1 369
Читаю резюме на Data quality analyst
Из интересного:
• часто встречаю Duckdb
• встречаю SQLMesh, но только в США (впереди планеты всей?)
• вижу корявые попытки использовать LLM для подстройки резюме под вакансию: I used dbt or sqlmesh for a data validation. Хочется спросить, что именно? Эти технологии взаимно исключающие
В Dwelly активно внедряю SQLMesh. Уже работает на базе Google BigQuery. Конечно я сразу делаю проект как open source в компании.
Также мне удалось применить SQLMesh для миграций данных. В связке Claude/Codex работает хорошо.
А пока я продолжаю искать Data Quality Analysts. Мне или бывший QA (кто много работал с проверкой данных), или data analysts/engineers, кто много занимался такими задачми как реконсиляция
https://job-boards.eu.greenhouse.io/dwelly/jobs/4937564101
1 369
```
Roman, Turing buys operating history from companies like Retail Rocket for frontier AI training, and pays up to $1M for it.
That's the record your team builds just by running: the code, the product decisions, the design, the tickets, the docs, the threads behind how you ship. We acquire a defined, de-identified copy of it. One time, under NDA, in an air-gapped environment. Your live systems and your business keep running exactly as they are, and you set what's in scope and what never leaves.
Nothing gets priced off a description. If it's a fit, we pull a representative sample, QA it, and build one valuation from that. One number, one contract, and the whole thing from first conversation to signed contract can take under a month.
Worth a look? Get in touch and I'll take it from there. If you'd rather get the full picture first, here's how it works.
Vijay Krishnan
Co-founder & CTO, Turing
```
похоже нужны данные для AI?
1 369
Что вы думаете об этом
https://sierra.ai/blog/the-ai-native-interview
Тут и AI кодинг и отдельно дебаггинг
1 369
Новая позиция, буду нанимать сразу двух человек.
Dwelly постоянно покупает агенства недвижимости, а это значит, что очень много работы требуется с интеграцией данных в нашу систему.
Не сильно сложная, но требующая максимальной внимательности!
https://job-boards.eu.greenhouse.io/dwelly/jobs/4937564101
1 369
Сегодня Dwelly подняла 170 млн.
Это значит, что продолжаю нанимать. Еще одна позиция будет, fully remote
https://www.bloomberg.com/news/articles/2026-07-28/ai-startup-dwelly-raises-170-million-for-real-estate-rollup
1 369
Я нанимал из вышки (ВШЭ) и физтеха (МФТИ).
И заметил одну интересную особенность, физтехи более амбициозны. У выпускников вышки более прямой карьерный трек. А вот у физтехов чаще стартапы появляются.
PS: это мое субъективное мнение подкрепленное исключитально собственной статистикой
1 369
Ищу к себе двух инженеров, удаленка
Вакансия ближе к разработке и ML
https://job-boards.eu.greenhouse.io/dwelly/jobs/4929545101
Вакансия ближе к разработке
https://job-boards.eu.greenhouse.io/dwelly/jobs/4928198101
1 369
Ducklake + DBT - случайно затер неправильными данными инкрементальные таблицы 🙁
но! Ducklake поддерживает версионность! А это значит их можно восстановить
memory D ATTACH 'ducklake:postgres:'
AS ducklake (
META_SECRET pg_metadata,
DATA_PATH 's3://corpsignals/ducklake',
METADATA_SCHEMA 'ducklake_catalog',
OVERRIDE_DATA_PATH true
);
memory D select count(*) from ducklake.intermediate.persons_all;
┌─────────────────┐
│ count_star() │
│ int64 │
├─────────────────┤
│ 10837423 │
│ (10.84 million) │
└─────────────────┘
memory D
memory D
memory D
memory D
memory D
memory D ATTACH 'ducklake:postgres:'
AS ducklake_before_refresh (
META_SECRET pg_metadata,
DATA_PATH 's3://corpsignals/ducklake',
METADATA_SCHEMA 'ducklake_catalog',
SNAPSHOT_TIME '2026-06-25 08:34:00'
);
memory D select count(*) from ducklake_before_refresh.intermediate.persons_all;
┌─────────────────┐
│ count_star() │
│ int64 │
├─────────────────┤
│ 16236012 │
│ (16.24 million) │
└─────────────────┘
вторая таблица - это прошлый snapshot. Видим, что там больше данных, и это праильно
команды ROLLBACK нет, поэтому делаем влоб
CREATE OR REPLACE TABLE ducklake.intermediate.persons_all AS
SELECT * FROM ducklake_before_refresh.intermediate.persons_all;1 369
Ну все, теперь без визы в UK. Через два года на паспорт (если власть не поменяется). Младший родившийся в Лондоне сын получит гражданство в этом году.
PS: заплатил за эту процедуру 4000 фунтов :(. Гос бизнес
1 369
У меня тут у знакомых в разных компаниях идут сокращения. Больше всего режут IT.
Причем так нормально, до половины состава. AI и прочее, не знаю к чему приведет.
Но есть одна важный вопрос, который бы я спросил на собеседовании у человека, которого уволили.
“Насколько ты был загружен в тот момент? А если было нечего делать, чего сам не ушел?”
Одно дело все пахали, и например денег не подняли, закрылись. Другой момент, когда сидишь ровно, делать особо нечего, ну или делаешь что-то неважное - пора уходить самостоятельно. Да, работа это проект, и менять его лучше вовремя.
1 369
Неделю назад я вышел в Dwelly Group, чтобы заняться всем дата стеком. Они занимаются скупкой и AI автоматизацией агенств недвижимости в UK в разы повышая эффективность бизнеса. Недавно они подняли 93 mln.
На заднем фоне очередное купленное агенство в Лондоне, которое нам нужно заинтегрировать.
1 369
Прошел год и теперь эта либа подходит для проверки JSON output даже у OpenAI моделей через API.
Проблема: когда вам нужно, чтобы LLM модель выдавала JSON, его нужно проверять на валидность.
Так вот https://dottxt-ai.github.io/outlines/latest/features/models/ библиотека умела раньше делать только для локальных моделей.
А теперь и с OpenAI, его API умеет возвращать вероятности по топ токенам!
Не нужно использовать отдельный API колл или валидацию, теперь все может работать из коробки.
PS: deepseek там нет, но у меня исчезли проблемы после того, как снизил температуру модели до нуля
1 369
Похоже у меня получилось с Ducklake.
Прикольная система, детали потом напишу. Stay tuned
1 369
Когда я вижу уже такие команды https://code.claude.com/docs/en/scheduled-tasks
То радуюсь, командная строка снова в строю! Скоро наверное уже будет операционная система
