en
Feedback
Нейросеть | Эстетика

Нейросеть | Эстетика

Open in Telegram

Сообщество профессионалов в области работы с данными и искуственным интеллектом

Show more
2 127
Subscribers
No data24 hours
-47 days
-1330 days
Posts Archive
тихо и незаметно в ChatGPT выкатилося o1 без приставки preview
тихо и незаметно в ChatGPT выкатилося o1 без приставки preview

The Art of Discoverability and Reverse Engineering User Happiness На днях обсуждали с коллегой какие перспективные темы есть в области управления данными и редакция высказала мысль, что задача Data Catalog так до сих пор и не решена. Пару лет назад к ней было приковано много внимания, но потом появились LLM и все убежали смотреть на них, а каталоги так и не вышли на какой-то более менее зрелый уровень. По итогам хотим поделиться статьей по теме Data Discoverability. В чем основные тезисы материала: ⁃ Основная идея - создание глобальной meta-модели данных описывающей всех источники данных организации ⁃ Решаемая проблема: работа с данными требует создания отдельных источников данных под каждый паттерн работы с данными что порождает в компаниях большое количество разрозненных источников часто с дублирующейся информацией ⁃ Данные очень динамичны, поэтому платформа метаданных должна следить за их постоянным развитием и поддерживать свежие метаданные, чтобы не допустить расхождений и пробелов между необработанными данными и бизнес-пониманием. ⁃ Что такое глобальная meta-model: модель данных для метаданных, позволяющая пользователям исследовать взаимосвязи и определять лучшие наборы данных, относящиеся к их текущему запросу. Она объединяет множество активов данных, источников, сервисов, целей и пользователей, обеспечивая логические связи, придающие данным смысл. Она активирует неактивные данные, подключая их к обширной сети экосистемы данных, позволяя пользователям и машинам начать использовать огромные объемы данных, которые ранее были бессмысленны из-за отсутствия семантики. ⁃ Плюсы наличия такой модели очевидно - и бизнесу и технологам жить сильно легче и проще 🙂 ⁃ Какие типы решений могут помочь в реализации: Catalogs, Data Hubs, Marketplaces https://moderndata101.substack.com/p/the-art-of-discoverability-and-reverse?utm_source=post-email-title&publication_id=1170209&post_id=153015029&utm_campaign=email-post-title&isFreemail=true&r=15862q&triedRedirect=true&utm_medium=email

Дайджест статей Каталог данных своими руками из PowerBi и небольшой БД https://habr.com/ru/companies/vkusvill/articles/864998/ Корпоративная школа BI: от таблиц на коленке до дашбордов, которые реально работают https://habr.com/ru/companies/leroy_merlin/articles/864328/ ML в промышленности: как построить систему управления процессом окомкования железорудных окатышей https://habr.com/ru/companies/oleg-bunin/articles/865088/ Миграция с Tableau на опенсорс-версию DataLens: лёгкий путь с препятствиями https://habr.com/ru/companies/yandex_cloud_and_infra/articles/865648/ Инфраструктура для Data-Engineer виртуальные окружения https://habr.com/ru/articles/861412/ Как решения Data Access Governance и Data Centric Audit Protection помогают бороться с утечками данных https://habr.com/ru/companies/solarsecurity/articles/866422/ Multi-Agent Conversation With AutoGen AI https://dzone.com/articles/multi-agent-conversation-with-autogen-ai LLMs may have a killer enterprise app: ‘digital labor’ — at least if Salesforce Agentforce is any indicator https://techcrunch.com/2024/12/04/llms-may-have-a-killer-enterprise-app-digital-labor-at-least-if-salesforce-agentforce-is-any-indicator/ Data Architectures in the AI Era: Key Strategies and Insights https://dzone.com/articles/data-architectures-in-the-ai-era Apache Iceberg: The Open Table Format for Lakehouses and Data Streaming https://dzone.com/articles/apache-iceberg-open-table-format-lakehouses-data-streaming Unlocking Enterprise Data Potential with Retrieval Augmented Generation https://www.smartdatacollective.com/unlocking-enterprise-data-potential-with-retrieval-augmented-generation/

Коллеги подсказали интересную статью - краткий обзор состояния рынка конфиденциальных вычислений. Редакцию эта тема особенно интересует, но, к сожалению, времени на ее предметное и практическое изучение не очень много остается, поэтому продолжаем пока больше наблюдать, чем изменять происходящее 🙂 В целом интересно: "Объем глобального рынка конфиденциальных вычислений по итогам 2024 г. будет находиться на уровне $824 млн (примерно 86 млрд руб.), прогнозируют в консалтинговой компании MarketsandMarkets. При этом на протяжении пяти лет, до 2029 г., темпы его ежегодного прироста будут составлять 11,4%, таким образом, к началу следующего десятилетия объемы мирового рынка MPC перевалят за $1,4 млрд." "«Для эффективной работы с данными необходимо создавать экосистемы для их совместного использования. Коммерческие и государственные организации ищут возможности взаимодействовать друг с другом так, чтобы не нарушать регуляторные ограничения и не разглашать чувствительную информацию. И здесь конфиденциальные вычисления могут стать серьезным подспорьем»" https://www.vedomosti.ru/technologies/trendsrub/articles/2024/12/03/1078864-konfidentsialno-i-tehnologichno

Обсуждали с коллегами сегодня алгоритм"vector clocks" и редакция решила и тут поделиться информацей и статьей о том что это такоею. Может быть кому то покажется интересным. vector clocks: - это такой метод установления seq num у сообщений, которыми обмениваются более 2-х компонентов работающих в распределенной среде с ненадежной средой передачи данных - предназначен для того, что бы гарантировать обработку сообщений принимающими компонентами в том же порядке, в котором они были сгенерированы в источнике в случае если мы не может гаранировать того, что они дойдут до приемника в том же порядке, в котором бы отправлены источником - приемник использует буфер, что бы накапливать приходящие сообщения и обрабатывать их по мере того, как востанавливается их порядок то есть основная идея/задача алгоритма - гарантировать, что сообщения будут обработаны приемником в том же порядке, что их генерировали источники краткое описание с примерами кода: https://www.geeksforgeeks.org/vector-clocks-in-distributed-systems/

Закон Бенфорда Для начала проведём мысленный эксперимент. Предположим, что у нас есть прибор, который может измерить всё что угодно - массу любой планеты, скорость света, период полураспада частицы, население любого города, объём песка в пустыне, глубину моря и т.д. Если мы заранее не знаем результата, то какова вероятность того, что первая цифра в измерении "1" (например, как заряд электрона, или населения Китая)? А какая вероятность того, что первая цифра в измерении "9" (например, как у постоянной Фарадея)? Теперь попробуйте ответить, изменится ли вероятность, если мы переключим наш прибор на другую единицу измерения - например, вместо метров будем использовать футы? Интуитивно можно предположить, что вероятность увидеть единицу на первом месте в измерении такая же, как и девятку. На самом деле это не так. В 1938 году физик Фрэнк Бенфорд проанализировал данные о площади бассейна сотен рек, удельной теплоёмкости и молекулярном весе тысяч химических соединений, номерах домов сотен улиц. Он выявил, что единица является первой значащей цифрой с вероятностью не 1/9, как следовало ожидать, а около 1/3! Закон первой цифры Закон Бенфорда (или закон первой цифры) гласит, что в реальной жизни цифра 1 на первом месте встречается гораздо чаще, чем все остальные. Также, чем меньше эта цифра, тем выше вероятность. То есть единица на первом месте встречается, приблизительно в 30% случаях, и примерно в 6 раз чаще, чем цифра 9. Если быть более точным, то вероятность появления цифры d на первом месте равна log10(1 + 1/d). Вы можете проверить это сами на простом примере. Составьте список файлов на вашем компьютере, а затем проанализируйте, на какую цифру начинается размер файла. Я лично проверил это на своих файлах - распределения первой цифры невероятно точно соответствуют закону Бенфорда. И кстати, как вы можете уже догадаться, система измерения не влияет на закон. Не важно, проводим ли мы измерение в секундах или часах - вероятность первой цифры не меняется.

Дайджест статей CRUS: принципиально новая архитектура работы с данными https://habr.com/ru/articles/863968/ Платформа данных в хранилище Магнит OMNI https://habr.com/ru/companies/magnit/articles/864472/ О векторных базах данных простым языком https://habr.com/ru/companies/ruvds/articles/863704/ Сколько стоит искусственный интеллект для малого бизнеса https://habr.com/ru/articles/864882/ NLP: когда машины начинают понимать нас (Часть 1) https://habr.com/ru/articles/864656/ NLP: когда машины начинают понимать нас (Часть 2) https://habr.com/ru/articles/864778/ NLP: когда машины начинают понимать нас (Часть 3) https://habr.com/ru/articles/864912/ Конкурентное преимущество: почему ИИ-агенты — ключ к успеху вашего бизнеса https://habr.com/ru/articles/864618/ Как TF-IDF обошел SOTA-модель BERT4Rec в персональных рекомендациях https://habr.com/ru/companies/wildberries/articles/861466/ Построение базы знаний компании и поиска документов на LLM и RAG https://habr.com/ru/companies/raft/articles/863888/ Пора перестать в любой непонятной ситуации строить DWH для аналитики https://habr.com/ru/articles/863308/

+1
Редакция приносит свои извинения за задержку дайджеста статей, связанную с посещением эпических мероприятий: завершения сезона формулы 1 и посещением концерта Эминема и обещает выпустить дайджест asap. В качестве извинений постим немного эксклюзива.

🏆Сергей Золотарев, основатель и директор по стратегическому развитию Arenadata, состоит в экспертном совете Data Award с мом
🏆Сергей Золотарев, основатель и директор по стратегическому развитию Arenadata, состоит в экспертном совете Data Award с момента создания премии. ✔️Сергей рассказал, какой путь премия прошла за годы существования, а также поделился наблюдениями, как, на его взгляд, изменилась профессия CDO, и идеями о том, что ждет ее в будущем. 📖Читайте подробнее в интервью с Сергеем➡️ "CDO должен соблюдать баланс между технологиями и бизнесом"

Люди уже совсем не стесняются :)
Люди уже совсем не стесняются :)

Call&Contact Centre EXPO На прошлой неделе редакция посетила мероприятие Call&Contact Centre EXPO и хотела бы поделиться неко
+1
Call&Contact Centre EXPO На прошлой неделе редакция посетила мероприятие Call&Contact Centre EXPO и хотела бы поделиться некоторыми заметками. В целом мероприятие было не очень большое по меркам Лондона, я бы сказал ближе к среднему размеру по площади и количеству участников. Конечно, как любое бесплатное мероприятие большую часть всей повестки занимали вендоры которые на сессиях рассказывали о своих решения. Мне удалось походить по выставке, посмотреть стенды и послушать только пару докладов, тк времени было не очень много. Большая часть выставки занимали традиционные вендоры работающие в области автоматизации колл центров (Verint, Nice, DCC) + вторые по величине были такие копании как Zoom и 8x8 которые в целом позиционируется на клиентских коммуникациях. Непосредственно каких-то особо инновационных стартапов я не очень много увидел, был интересный стенд у Boost.AI, но больше не могу кого то отметить. В целом общая повестка - использование GenAI в клиентских коммуникациях. Так же в части орган...

Дайджест статей Михаил Водолагин, ex-CDO Deeplay: «Люди умудряются выстрелить себе в ногу очень по-разному!» https://habr.com/ru/articles/860322/ Scaling the Instagram Explore recommendations system https://engineering.fb.com/2023/08/09/ml-applications/scaling-instagram-explore-recommendations-system/ Репликация данных с использованием Debezium и Kafka https://habr.com/ru/articles/861868/ Человек и LLM: как построить метрики для оценки моделей https://habr.com/ru/companies/yandex/articles/861084/ Извлечение метаданных из Power BI https://habr.com/ru/articles/862052/ Инфраструктура для Data-Engineer форматы файлов https://habr.com/ru/articles/859968/ Миграция данных: косяки и работа над ошибками https://habr.com/ru/articles/862324/ Как приготовить DataVault и не испортить Greenplum https://habr.com/ru/companies/x5digital/articles/862384/ Зачем нам ИИ-агенты? https://habr.com/ru/companies/piter/articles/862314/ Как организовать разметку данных для ML? Советы от Data Light https://habr.com/ru/companies/data_light/articles/862464/

Редакция сегодня посетила мероприятие Call & Contact Centre EXPO Автоматизация коммуникации с клиентами уже много лет остаетс
+5
Редакция сегодня посетила мероприятие Call & Contact Centre EXPO Автоматизация коммуникации с клиентами уже много лет остается областью, где технологии ИИ являются самыми востребованными и где результат из применения очевиден и понятен и каждый из нас может на себя почувствовать всю их мощь когда звонит в любимый банк или телеком провайдеру. В целом выставка не удивила, все стенды плюс минус про одно и тоже, поэтому более ценны тут выступления и нетворкинг. Из выступлений послушать удалось не много но одно было очень интересное. Из ключевых выводов: в то время как ИИ закрывает простые и массовые вопросы, на колл центры смещается нагрузка в части более сложных кейсов требующих большей продолжительности диалога Самый лучший источник знаний для ИИ - предыдущие диалоги и разговоры с оператором. Поэтому именно к этой категории данных следует относится максимально внимательно. А еще было очень интересно что организаторы пускали при докладах real time транскрипцию на экранах. Удобно :)

Предиктивная аналитика на базе ИИ В мире бизнеса предиктивная аналитика на базе искусственного интеллекта становится неотъемл
Предиктивная аналитика на базе ИИ В мире бизнеса предиктивная аналитика на базе искусственного интеллекта становится неотъемлемым инструментом для оптимизации процессов и повышения эффективности. В новой статье мы вместе с коллегами рассмотрели, как компании используют машинное обучение для предсказания поведения клиентов и улучшения маркетинговых стратегий. Узнайте, как современные технологии помогают банкам и производителям товаров личной гигиены находить свою целевую аудиторию и минимизировать риски мошенничества. Полная версия по ссылке

Интересные кейсы! Довольно конкретно и без воды, посмотрите.

Сегодня были объявлены победители премии CNews Награду в номинации «Управление данными в промышленности» получил проект, реализованный компаниями ЕВРАЗ и Tdata. Использование RT.Data Governance при создании единой системы производственных показателей в компании ЕВРАЗ позволило обеспечить документирование данных, ведение единого глоссария терминов и алгоритмов расчета показателей. Скорость разработки витрин данных и аналитических дэшбордов увеличилась вдвое. На сегодняшний день в систему внесено более 6 тыс. производственных показателей, из которых 3 тыс. уже содержат детализированное описание. https://biz.cnews.ru/articles/2024-11-19_obyavleny_laureaty_cnews_awards_2024

Только начал читать эту книгу, но уже после первых 2-3 глав испытал такой восторг, что спешу рекомендовать ее к обязательному прочтению! Очень интересная теория уровней развития корпоративной культуры, которая отлично соотносится с моим собственным опытом и помогает систематизировать многое из того, что я наблюдаю как вокруг, так и в себе. Авторы выделяют 5 моделей культуры группы, и особенно мне понравилось, что они подчеркивают: в одной и той же организации разные группы, отделы и даже отдельные люди могут находиться на разных уровнях. Более того, они способны перемещаться между этими уровнями в зависимости от обстоятельств. На мой взгляд, это очень верная теория, и я сам замечаю такие перемещения в своем поведении. В книге представлен полезный framework для диагностики, который помогает определить, на каком уровне находится ваша организация, а также рекомендации для тех, кто, как менеджер, хочет внести изменения в своей компании. https://www.goodreads.com/book/show/34375294

В то время, как мы говорим о гипер-автоматизации всего и вся и в первую очередь в коммуникациях с клиентами, некоторые игроки
В то время, как мы говорим о гипер-автоматизации всего и вся и в первую очередь в коммуникациях с клиентами, некоторые игроки рынка (это скрин онбординг экрана из мобильного приложения Mettle - проекта банка NatWest) заявляют human-based поддержку как преимущество для клиентов :)

Немного юмора :)
Немного юмора :)

Дайджест статей ИИ-инструменты для аналитиков: теория, кейсы, советы https://habr.com/ru/companies/korus_consulting/articles/860242/ Почему ИИ рано поручать код-ревью https://habr.com/ru/articles/859582/ Модели данных в BI-платформах: физика против логики https://habr.com/ru/companies/axenix/articles/860094/ CedrusData Catalog — новый технический каталог с поддержкой Iceberg REST API https://habr.com/ru/companies/cedrusdata/articles/860356/ Секреты построения Data Vault 2.0: эффективное хранение данных https://habr.com/ru/companies/cinimex/articles/857084/ I spent another 8 hours understanding the design of Amazon Redshift. Here’s what I found. https://blog.det.life/i-spent-another-8-hours-understanding-the-design-of-amazon-redshift-heres-what-i-found-85c31a59fd19 I spent 5 hours understanding more about the Delta Lake table format https://blog.det.life/i-spent-5-hours-understanding-more-about-the-delta-lake-table-format-b8516c5091eb Apache Superset 2024. Лучшие практики https://habr.com/ru/companies/otpbank/articles/815689/ A data-driven approach to making better choices https://news.mit.edu/2024/data-driven-approach-making-better-choices-0606