Нейросеть | Эстетика
Open in Telegram
Сообщество профессионалов в области работы с данными и искуственным интеллектом
Show more2 127
Subscribers
No data24 hours
-47 days
-1330 days
Posts Archive
2 127
Немного инсайдерской информации про Apple от Bloomberg. Siri+ не будет 🙂
Интересно, что на фоне заметных шагов вперед у Alexa и Google, Siri продолжает буксовать и сейчас похоже уже можно говорить о том что Siri+ не будет до 2026 года. К сожалению в статье не описываются конкретные сложности, с которыми столкнулась команда, а было бы интересно узнать. Попробуем погыпытышить.
"Walker said the decision to delay the features was made because of quality issues and that the company has found the technology only works properly up to two-thirds to 80% of the time"
Особенно выделяется то, что Apple уже демонстрировала Siri+ на прошлой конференции для разработчиков, а они никогда не показывают на конференции то, в запуске чего не уверены. Это возможно первый раз когда они отходят от этого правила.
Но тем не менее они остаются привержены своей парадигме "But Apple wants to maintain a high bar and only deliver the features when they’re polished" и не стараются притянуть запуски к каким то памятным датам - остается достойной уважения такая позиция в части продуктовой разработки.
https://www.bloomberg.com/news/articles/2025-03-14/apple-s-siri-chief-calls-ai-delays-ugly-and-embarrassing-promises-fixes?accessToken=eyJhbGciOiJIUzI1NiIsInR5cCI6IkpXVCJ9.eyJzb3VyY2UiOiJTdWJzY3JpYmVyR2lmdGVkQXJ0aWNsZSIsImlhdCI6MTc0MjE1NTk3MSwiZXhwIjoxNzQyNzYwNzcxLCJhcnRpY2xlSWQiOiJTVDMxRE1EV1JHRzAwMCIsImJjb25uZWN0SWQiOiJFQTExNDNDNTM4NEE0RUY5QTg5RjJEN0IxMTg2MzcwOSJ9.NIVHf5K-5EZVbtJFJbkn_R9BqHrNdEJXTdo7m3SxsF4&utm_source=tldrnewsletter&leadSource=uverify%20wall
2 127
Что читать про данные в 2025 году?
Хочу поделиться некоторыми источниками статей, которые редакция регулярно обрабатывает для подготовки дайджестов.
habr.com — основной источник. Вы, наверное, заметили, что в дайджест попадает очень много материалов отсюда. Статьи здесь разные: есть большие, качественные и вдумчивые, а есть плохо сделанные переводы.
medium.com — оригинал Habr на английском языке. Очень хорошие статьи: объемные, с полезными и практичными инсайтами. Отдельно стоит отметить удобную рекомендательную систему, которая помогает ориентироваться в большом количестве материалов.
semianalysis.com — это в основном платный источник, так как авторы обычно распространяют материалы по подписке. Некоторые из них стоят достаточно дорого, но качество содержания всегда на высоте. Статей не так много, но каждая достойна отдельного изучения с карандашом.
https://substack.com/home-i - тоже очень неплохой, но сложно находить на нем релевантные материалы
https://news.mit.edu — здесь обычно встречаются интригующие заголовки, но сами материалы часто не слишком глубокие.
https://dzone.com — всё чаще встречаются небольшие заметки, а действительно качественные материалы попадаются редко.
https://www.infoq.com — полезный ресурс: здесь можно найти не только новости, но и презентации с расшифровками, а также крупные статьи.
Блоги технологических компаний — их не привожу здесь списком, но ранее публиковал в постах. Также полезными источниками остаются LinkedIn и Twitter, где можно найти интересные ссылки и посты.
Вопрос к аудитории: что вы могли бы добавить в этот список? Какие источники вы регулярно читаете? Делитесь в комментариях!
2 127
ИМХО очень неплохая статья
https://clickhouse.com/blog/building-a-data-warehouse-with-clickhouse
2 127
Редакция понимает, что достала всех уже этими агентами, но что бы закрыть тему:
https://www.llmwatch.com/p/a-non-technical-introduction-to-ai?utm_source=post-email-title&publication_id=1428667&post_id=151269796&utm_campaign=email-post-title&isFreemail=true&r=15862q&token=eyJ1c2VyX2lkIjo2OTI0NTM3OCwicG9zdF9pZCI6MTUxMjY5Nzk2LCJpYXQiOjE3MzI2NDIyNDksImV4cCI6MTczNTIzNDI0OSwiaXNzIjoicHViLTE0Mjg2NjciLCJzdWIiOiJwb3N0LXJlYWN0aW9uIn0.IgM3I67NlSN8gRiOu1gnZ8kJSCU0UgAZK4WhINw9rus&triedRedirect=true
2 127
Дайджест статей
Как LLM меняют архитектуру систем: от простых дата-пайплайнов к интеллектуальным автономным агентам
https://habr.com/ru/articles/868648/
Кастомизация в Luxms BI: программируем под свои желания
https://habr.com/ru/companies/luxms_bi/articles/870684/?utm_source=habrahabr&utm_medium=rss&utm_campaign=870684
Чем занимаются дата-сайентисты в Авито — полный разбор
https://habr.com/ru/companies/avito/articles/870672/
Инфраструктура для Data-Engineer Liquibase
https://habr.com/ru/articles/863242/
Опыт Звука: как реализовать рекомендательную систему аудиокниг с использованием больших языковых моделей (LLM)
https://habr.com/ru/companies/zvuk/articles/869664/
Unity Catalog: Revolutionizing Data Governance and Collaboration in the Modern Era
https://towardsdev.com/unity-catalog-revolutionizing-data-governance-and-collaboration-in-the-modern-era-4bef053b972d?gi=f74e30595346
Universal data lakehouse: The most vendor/tool neutral data architecture
https://atwong.medium.com/universal-data-lakehouse-the-most-vendor-tool-neutral-data-architecture-b247b4fedf0a
Top 20 Platform Engineering Tools
https://medium.com/spacelift/top-20-platform-engineering-tools-7e9c7289fb94
Solve Governance Debt with Data Products
https://medium.com//solve-governance-debt-with-data-products-bc17e95384b0
Реальное внедрение LLM в бизнес-процессы (3 кейса)
https://habr.com/ru/articles/868784/
Как не нужно визуализировать данные: антипаттерны в примерах
https://habr.com/ru/articles/868870/?utm_source=habrahabr&utm_medium=rss&utm_campaign=868870
Tarantool CDC. Жизнь данных в гетерогенной среде
https://habr.com/ru/companies/vk/articles/868406/
Как выбрать вкусное вино на основе данных с помощью Luxms BI
https://habr.com/ru/companies/luxms_bi/articles/869382/
Безопасная миграция данных из Vault одной командой
https://habr.com/ru/companies/flant/articles/869290/
Дата-контракты: как мы научили жить дружно источники и потребителей данных
https://habr.com/ru/companies/ru_mts/articles/868384/
The Future of Data Lies in Transformer Models vs. Big Data Transformations
https://dzone.com/articles/the-future-of-data-lies-in-transformer-models-vs-b
Data Warehousing (DWH) best practices
https://rihab-feki.medium.com/data-warehousing-dwh-best-practices-ef9c61cf657d
2 127
+1
А не хайп ли это всё?
Может ИИ-агент ничем не отличается от "обычной" программы, а вся эта "автономность", "наличие инструментов" и LLM - не более, чем маркетинговый шум?
Давайте попробуем разобраться. Хайпа вокруг темы ИИ-агентов, действительно много.
Кто только не назвал 2025 год - годом AI-агентов в своих прогнозах!
(спойлер - я среди них)
Начнем с определения. TM Forum всегда отличался системным подходом сначала к систематизации телекома, а последние годы и любого цифрового бизнеса.
Поэтому будем опираться на формулировки этой организации, которая буквально месяц назад выпустила первый документ
"AI Agent v1.0.0" (IG1274M).
❗️ ИИ-Агент - это система искусственного интеллекта, которая использует LLM в качестве основного вычислительного механизма, что позволяет ей вести диалог, выполнять задания, рассуждать и демонстрировать определенную степень автономности.
Любой интеллектуальный агент должен обладать 5 ключевыми способностями:
1️⃣ Восприятие - сбор данных из окружающей среды
2️⃣ Классифика...
2 127
Крутейший выпуск научных итогов года с большим блоком о космических достижениях:
https://youtu.be/B0CZfE5Qhlo?si=z3AAkJz3LwsWzpoH
2 127
AI Агенты
Что то тут решил разобраться что такое “AI Agent”, а то с одной стороны в голове вроде как есть какое то интуитивное понимание, но с другой нет четкого определения. Кроме этого постоянно вижу в разных канал всякие дискуссии на тему этого определения. Плюс, как любая новая и модная тема (вспоминаем термин Big Data) на это определение навешивают все, что только можно.
Итак, я бы дал такое определение: AI агент - программное обеспечение функционирующее с применением технологий ИИ, имеющее возможность активного взаимодействия с внешними системами и предназначенное для выполнение конкретной задачи.
Технологии ИИ - тут могут быть любые, от традиционного ML до нейросетей и, конечно, LLM
Активное взаимодействие - в теме агентов делается акцент на том, что система должна уметь выполнять какие то действия, а не просто многозначительно отвечать на вопросы
Конкретная задача - как показывает практика, что бы агент 007 мог выполнять какую то конкретную роль, надо немало постараться и сделать много всяких интеграций, запрограммировать правила, проверки и тд и тп. Поэтому чем более узкоспециализированный агент - тем лучше, а комплексные системы принято собирать из большого количества “мелких” агентов.
То есть по сути - обычный софт, но с LLM внутри, которую агент бомбит преднастроенными промпами 🙂
Является ли LLM тут необходимым элементом? ИМХО нет, но сейчас термин ИИ стал равен LLM, как когда то он был равен нейросетям, до этого ML и Байсовскому выводу, а когда то просто калькулятору.
Шаги для решения задачи могут быть организованы в виде цепочки, дерева или графа. Фреймворки задают структуру и организуют процесс рассуждений агента.
Для линейных задач подходит фреймворк Chain of Thought (CoT), где каждое действие следует за предыдущим. Этот фреймворк используется в OpenAI o1.
Для более сложных задач используются фреймворки Tree of Thought или Graph of Thought, которые учитывают несколько возможных вариантов развития событий.
Ну и по сути самая соль разработки агента это моделирование цепочки рассуждений/уточнений/действий и тд. которые задаются самыми различными методами и способами. По сути напоминает движение в сторону какого-то “вероятностного” программирования вместе детерминистического описания алгоритма, но тем не менее все равно это напоминает разработку алгоритма выполнения задачи только с гораздо более большим пространством вариантов действий.
https://youtu.be/KrRD7r7y7NY?si=USrlIMO0pN2IAJWU
https://blogs.epsilonmetrics.ru/ii-agenty-i-multiagentnye-sistemy/
2 127
Немного космических новостей в нашем канале. 24 декабря 2024 года зонд Parker Solar Probe совершил исторический пролет, приблизившись к Солнцу на рекордное расстояние в 6,1 миллиона километров3. При этом аппарат развил феноменальную скорость около 700 000 километров в час. Подтверждение успешного маневра ожидается 27 декабря, когда зонд должен отправить сигнал на Землю (ждем пока еще).
Parker Solar Probe - это космический аппарат NASA, запущенный в 2018 году для революционного исследования Солнца и его атмосферы. Это самый быстрый объект, когда-либо созданный человеком.
Аппарат оснащен уникальной системой тепловой защиты, позволяющей ему выдерживать температуры до 1371°C а солнечные панели показывают меньшую деградацию, чем прогнозировалось, что обеспечивает более эффективную работу.
Ключевые задачи исследования:
- Изучение солнечного ветра и механизмов его образования
- Исследование солнечной короны и причин её аномально высокой температуры
- Анализ магнитных полей Солнца и, что самое инетресно, понятие причин их возникновения
- Изучение корональных выбросов массы
https://www.youtube.com/watch?v=JB64c2y_sqU&list=WL&index=1
2 127
Кстати, вышел новый Альманах "Искусственный интеллект", я так понимаю что это обзор за 2023 год.
https://aireport.ru/ai_index_russia-2023
2 127
А кто какие "обертки" над LLM использует? Редакция все больше любит Perplexia и потихоньку переползает на нее с нативного приложения ChatGPT. Мешает только то что при включенном VPN приложение не работает, только браузер 🙁
А у кого какие определились похожие любимые сервисы?
2 127
О, Telegram вышел на точку безубыточности вдруг. Не зря Павел сидел :)))
https://www.perplexity.ai/page/telegram-turns-profit-CPOhpyd1SdSHzHryuaHLIw
2 127
И немного о трендах. Тем более чем ближе конец года, тем больше статей о трендах на следующий 🙂
Коротко о сути: Apache доминирует, Iceberg наше все, Atlas похоже единственный достойный каталог в природе
https://medium.com/towards-data-engineering/data-engineering-2-0-trends-that-are-shaping-the-industrys-future-8d9415ddaa1d
2 127
Дайджест статей
Druid Deprecation and ClickHouse Adoption at Lyft
https://eng.lyft.com/druid-deprecation-and-clickhouse-adoption-at-lyft-120af37651fd
Dear IT Departments, Please Stop Trying To Build Your Own RAG
https://pub.towardsai.net/dear-it-departments-please-stop-trying-to-build-your-own-rag-4546b4638273
Какие сложности мы преодолели при внедрении RFM-сегментации клиентов в Авито Недвижимости
https://habr.com/ru/companies/avito/articles/863960/
Харденинг баз данных
https://habr.com/ru/companies/otus/articles/866810/
Какой тип разметки данных требуется для вашего проекта? Полный гид по аннотированию изображений
https://habr.com/ru/companies/data_light/articles/868464/
Что такое метаданные в BI и как ими управлять? Обзор инструмента OpenMetadata
https://habr.com/ru/articles/868336/
Ошибайся смело: жизненные уроки из мира machine learning
https://habr.com/ru/companies/ru_mts/articles/867710/
The Missing Piece to Data Democratization is More Actionable Than a Catalog
https://medium.com/conveyordata/the-missing-piece-to-data-democratization-is-more-actionable-than-a-catalog-add3b0583fa0
Генерация дашборда по DAX мере через AI DAX движок
https://habr.com/ru/articles/866534/
Data driven на практике: с чего начать, как избежать ошибок и эффективно применять
https://habr.com/ru/companies/beeline_cloud/articles/867292/
Плюсы и минусы Luxms BI: честный взгляд на платформу от вендора
https://habr.com/ru/companies/luxms_bi/articles/867262/
2 127
Лучшие книги 2024
Сегодня вместо дайжеста статей (перенесем его на завтра, с вашего позволения) будет долгожданный многими пост со списком лучших из 100 прочитанных редакцией в этом году книг. Тем более что по давней традиции Новый год у редакции начинается именно сегодня, а тут как раз в целом и сотню удалось добить 🙂 Не будем долго философствовать:
Книга года: Мобилизованная нация. Германия 1939–1945 - Nicholas Stargardt - лучшее что прочитал, хотя Пикуль с “Барбаросса” прям шли нога в ногу, тем не менее отдаю первенство именно этому произведению. Must read.
Остальной ТОП в разрезе каждой традиционной категории:
Секция "Художественная литература"
1. Orbital - Samantha Harvey
2. A View from the Bridge - Arthur Miller
3. Увидимся в августе - Gabriel García Márquez
4. Dark Matter - Blake Crouch
5. Disclaimer - Renée Knight
Секция "Биографии, философия и история"
6. Барбаросса (все 3-х тома) - Valentin Pikul
7. Истинноверующий. Мысли о природе массовых движений - Eric Hoffer
8. Мировой порядок - Henry Kissinger
9. Сказать жизни ДА!: психолог в концлагере - Viktor E. Frankl
Секция "Научпоп и вокруг него"
10. Helgoland: Making Sense of the Quantum Revolution - Carlo Rovelli
11. Невозможное в науке: расследование загадочных артефактов - Александр Никонов
12. Дизайн всего: Как появляются вещи, о которых мы не задумываемся - Scott Berkun
13. Шесть невозможностей: Загадки квантового мира - John Gribbin
14. История Бога. 4000 лет исканий в иудаизме, христианстве и исламе - Karen Armstrong
Секция "Саморазвитие и менеджмент”
15. The Culture Map: Breaking Through the Invisible Boundaries of Global Business - Erin Meyer
16. The Diary of a CEO: The 33 Laws of Business and Life - Steven Bartlett
17. Atomic Habits: An Easy & Proven Way to Build Good Habits & Break Bad Ones - James Clear
18. The Hard Thing About Hard Things: Building a Business When There Are No Easy Answers - Ben Horowitz
19. Чиллософия: Опыты выхода из безвыходности - Ирина Хакамада
20. The Venture Mindset: How to Make Smarter Bets and Achieve Extraordinary Growth - Ilya Strebulaev
21. Лидер и племя. Пять уровней корпоративной культуры - Dave Logan
22. Кругом одни идиоты. Если вам так кажется, возможно, вам не кажется. - Thomas Erikson
Секция "Библия разработчика"
23. Повелители DOOM. Как два парня создали культовый шутер и раскачали индустрию видеоигр - David Kushner
24. Fundamentals of Software Architecture: An Engineering Approach - Mark Richards
25. Mars Rover Curiosity: An Inside Account from Curiosity's Chief Engineer - Rob Manning
2 127
Benchmark For Analytical DBMS
Вы когда нибудь имели диску на тему какая BD быстрее? Тогда наверное знаете, что нет правильного ответа на этот вопрос и что выбор BD должен быть обоснован конкретным кейсом и даже такие вещи как “распределение различных значений” в типовом профиле нагрузке на BD - важно.
В мире есть довольно большое количество рейтингов и сравнений разных BD но хитрость в том, что всегда надо смотреть на то на каких данных делается это сравнение, потому что хитрые производители BD всегда используют именно такой дата-сет, на котором они показывают лучшие результаты.
Вот примеры разных сравнений сравнений:
ClickBench — a Benchmark For Analytical DBMS: https://benchmark.clickhouse.com/
Brown University Mgbench: https://github.com/andrewcrotty/mgbench
UC Berkeley AMPLab Big Data Benchmark: https://amplab.cs.berkeley.edu/benchmark/
Mark Litwinschik's NYC Taxi: https://tech.marksblogg.com/benchmarks.html
h2o.ai https://h2oai.github.io/db-benchmark/
TPC-H: https://www.tpc.org/tpch/
TPC-DS: https://www.tpc.org/tpcds/
А вот очень неплохая статья со ссылками на описания особенности разных BD и другие рейтинги: https://habr.com/ru/companies/ruvds/articles/851330/
