ar
Feedback
Data Science. SQL hub

Data Science. SQL hub

الذهاب إلى القناة على Telegram

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

إظهار المزيد

📈 نظرة تحليلية على قناة تيليجرام Data Science. SQL hub

تُعد قناة Data Science. SQL hub (@sqlhub) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 35 970 مشتركاً، محتلاً المرتبة 3 638 في فئة التكنولوجيات والتطبيقات والمرتبة 17 609 في منطقة روسيا.

📊 مؤشرات الجمهور والحراك

منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 35 970 مشتركاً.

بحسب آخر البيانات بتاريخ 05 أكتوبر, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار -14، وفي آخر 24 ساعة بمقدار 5، مع بقاء الوصول العام مرتفعاً.

  • حالة التحقق: غير موثّقة
  • معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 7.31‎%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 3.80‎% من ردود الفعل نسبةً إلى إجمالي المشتركين.
  • وصول المنشورات: يحصل كل منشور على متوسط 2 628 مشاهدة. وخلال اليوم الأول يجمع عادةً 1 366 مشاهدة.
  • التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 9.
  • الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل sql, индекс, postgres, index, sqlite.

📝 الوصف وسياسة المحتوى

يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
“По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ”

بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 06 أكتوبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.

35 970
المشتركون
+524 ساعات
+307 أيام
-1430 أيام

جاري تحميل البيانات...

جذب المشتركين
أكتوبر '26
أكتوبر '26
+76
في 0 قنوات
سبتمبر '26
+374
في 31 قنوات
Get PRO
أغسطس '26
+388
في 40 قنوات
Get PRO
يوليو '26
+378
في 42 قنوات
Get PRO
يونيو '26
+245
في 1 قنوات
Get PRO
مايو '26
+272
في 0 قنوات
Get PRO
أبريل '26
+220
في 0 قنوات
Get PRO
مارس '26
+398
في 22 قنوات
Get PRO
فبراير '26
+483
في 45 قنوات
Get PRO
يناير '26
+634
في 128 قنوات
Get PRO
ديسمبر '25
+353
في 3 قنوات
Get PRO
نوفمبر '25
+623
في 49 قنوات
Get PRO
أكتوبر '25
+373
في 16 قنوات
Get PRO
سبتمبر '25
+519
في 38 قنوات
Get PRO
أغسطس '25
+328
في 13 قنوات
Get PRO
يوليو '25
+3 300
في 123 قنوات
Get PRO
يونيو '25
+642
في 71 قنوات
Get PRO
مايو '25
+434
في 4 قنوات
Get PRO
أبريل '25
+513
في 28 قنوات
Get PRO
مارس '25
+326
في 3 قنوات
Get PRO
فبراير '25
+541
في 42 قنوات
Get PRO
يناير '25
+1 884
في 59 قنوات
Get PRO
ديسمبر '24
+935
في 62 قنوات
Get PRO
نوفمبر '24
+1 515
في 193 قنوات
Get PRO
أكتوبر '24
+1 959
في 66 قنوات
Get PRO
سبتمبر '24
+1 275
في 200 قنوات
Get PRO
أغسطس '24
+1 054
في 43 قنوات
Get PRO
يوليو '24
+1 069
في 52 قنوات
Get PRO
يونيو '24
+1 419
في 59 قنوات
Get PRO
مايو '24
+1 087
في 39 قنوات
Get PRO
أبريل '24
+1 314
في 47 قنوات
Get PRO
مارس '24
+1 548
في 26 قنوات
Get PRO
فبراير '24
+1 855
في 8 قنوات
Get PRO
يناير '24
+2 203
في 45 قنوات
Get PRO
ديسمبر '23
+861
في 41 قنوات
Get PRO
نوفمبر '23
+3 544
في 43 قنوات
Get PRO
أكتوبر '23
+977
في 18 قنوات
Get PRO
سبتمبر '23
+996
في 0 قنوات
Get PRO
أغسطس '23
+1 461
في 0 قنوات
Get PRO
يوليو '23
+866
في 0 قنوات
Get PRO
يونيو '23
+669
في 0 قنوات
Get PRO
مايو '23
+453
في 0 قنوات
Get PRO
أبريل '23
+512
في 0 قنوات
Get PRO
مارس '23
+541
في 0 قنوات
Get PRO
فبراير '23
+3 419
في 0 قنوات
Get PRO
يناير '23
+946
في 0 قنوات
Get PRO
ديسمبر '22
+727
في 0 قنوات
Get PRO
نوفمبر '22
+1 282
في 0 قنوات
Get PRO
أكتوبر '22
+580
في 0 قنوات
Get PRO
سبتمبر '22
+1 026
في 0 قنوات
Get PRO
أغسطس '22
+248
في 0 قنوات
Get PRO
يوليو '22
+345
في 0 قنوات
Get PRO
يونيو '22
+611
في 0 قنوات
Get PRO
مايو '22
+3 409
في 0 قنوات
Get PRO
أبريل '22
+582
في 0 قنوات
Get PRO
مارس '22
+573
في 0 قنوات
التاريخ
نمو المشتركين
الإشارات
القنوات
06 أكتوبر+9
05 أكتوبر+13
04 أكتوبر+25
03 أكتوبر+6
02 أكتوبر+14
01 أكتوبر+9
منشورات القناة
⚡️ SQL с подвохом: NULL в пустом списке Что выведет PostgreSQL?

SELECT
  NULL IN (SELECT 1 WHERE FALSE)     AS a,
  NULL NOT IN (SELECT 1 WHERE FALSE) AS b;
Ответ: `a = false`, `b = true`. Подзапрос возвращает **ноль строк**. Совпадений нет, поэтому `IN` возвращает `false`, а `NOT IN` возвращает `true`, даже если проверяемое значение равно `NULL`. Для сравнения: `NULL IN (1)` вернёт NULL. Пустой набор меняет результат.

2
DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯 Лукас Фогель собрал SQLDoom: игровая логика и рендери
DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯 Лукас Фогель собрал SQLDoom: игровая логика и рендеринг оригинального DOOM работают внутри CedarDB. Карты, монстры, оружие и состояние игры хранятся в таблицах. SQL рассчитывает движение, атаки и столкновения, а затем собирает картинку: • около 1300 строк SQL и 89 CTE отвечают за рендеринг; • ещё 5900 строк SQL реализуют игровую логику; • кадры 320×200 генерируются примерно с 60 FPS на ноутбуке с Ryzen 7 PRO 7840U. В тяжёлых сценах частота падает до 35 FPS. Python обрабатывает ввод, задаёт тайминг и выводит готовые кадры. Работает даже мультиплеер. Теперь оптимизировать SQL нужно ещё и для того, чтобы монстры не лагали ☕️ Код: https://github.com/cedardb/sqldoom Онлайн-демка: https://demo.cedardb.cloud/projects/38c0ee59-327d-495e-ad40-735521bba941
2 634
3
Из аналитика в дата-инженеры: переход реален? 🤔 В последнее время все чаще дата-инженерия для аналитиков становится более пр
Из аналитика в дата-инженеры: переход реален? 🤔 В последнее время все чаще дата-инженерия для аналитиков становится более привлекательной, но в то же время страшной. С одной стороны, хочется понимать не только то, что происходит с данными, но и как эти данные вообще доезжают до нас. Откуда берутся, где хранятся, как обновляются, почему сегодня в витрине 10 млн строк, а завтра 8 млн и кто опять сломал загрузку🥲 И получается ситуация, когда хочется попробовать, но непонятно, с чего начинать и сколько лет на это закладывать. Поэтому мне понравилось, как Симулейтив пересобрали свой буткемп «Инженер данных». Курс разделен на 2 этапа: за первые 10 недель вы осваиваете базу и доходите до уровня junior-специалиста. А на втором этапе — углубленное изучение ключевых инструментов, где вы дорастаете до мидла. Что вас ждет на курсе: ➖SQL, Python, пайплайны сбора и обновления данных, хранение и обработка, DWH; ➖Живые занятия с ментором каждую неделю — не записи, а разборы вживую; ➖Подготовка к собеседованиям с первых недель, а не в самом конце; ➖ИИ-инструменты как часть программы — учите работать с ними, а не избегать; ➖Гостевые лекции от практикующих дата-инженеров из Яндекса, Т-Банка, Авито, Сбера, OZON; ➖Официальный диплом о профессиональной переподготовке. Кому подойдёт: 1. Тем, кто хочет войти в дата-инженерию с нуля или перейти из аналитики; 2. Тем, кто пробовал учиться самостоятельно, но теряет темп без структуры; 3. Тем, кому интереснее не просто считать метрики, а выстраивать систему, на которой держатся данные. Почему сейчас: специалистов, которые управляют данными как системой, на рынке меньше, чем нужно, — а спрос растёт, потому что без инженерии любые данные быстро превращаются в хаос. 🔥ВАЖНО: Симулейтив дают возможность получить грант обучение и гарантируют трудоустройство своих студентов. Количество грантов ограничено! Оставляйте заявку до завтра включительно, чтобы занять одно из 5 оставшихся мест нового потока! 🔗 ЗАБРОНИРОВАТЬ МЕСТО
1 665
4
🧠 TIL: SQLite превращает числа в текст сразу по две цифры Обычно integer → string делают циклом: / 10 → берём цифру % 10 → о
🧠 TIL: SQLite превращает числа в текст сразу по две цифры Обычно integer → string делают циклом: / 10 → берём цифру % 10 → остаток и повторяем снова. SQLite идёт хитрее. В исходниках есть строка на 200 символов, содержащая все пары от 00 до 99: 000102030405...979899 При преобразовании числа SQLite обрабатывает его по две цифры за раз и просто берёт нужную пару символов по индексу. То есть вместо множества операций /10 и %10: делим на 100 → получаем две цифры → копируем готовую пару. Маленькая оптимизация, но именно из таких деталей и состоит быстрый системный код. Исходник: sqlite/src/util.c
1 884
5
GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку. Идея простая:
GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку. Идея простая: больше сгенерированного кода ещё не означает больше пользы. GitHub предлагает строить работу вокруг трёх вещей: - Governance — что агентам можно делегировать и где нужен человек - Shared Knowledge — код, документация, решения, телеметрия и контекст - Customer Value — приносит ли ускорение реальную пользу пользователям Сам процесс делится на цикл Define → Deliver → Detect, а человек и AI могут выступать как director, performer или assessor. Главная метрика: скорость должна расти без роста дефектов и потери качества. https://github.com/resources/insights/agentic-engineering-system
2 107
6
ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки данных, атаки на модели, небезопасные
ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки данных, атаки на модели, небезопасные сценарии работы агентов — проблемы, которые проще предупредить на этапе проектирования, чем исправлять после запуска. На открытом уроке разберём, как создавать ИИ-системы с учетом требований безопасности с самого начала. Вы узнаете, какие угрозы характерны для LLM, как применять принципы Security by Design и какие архитектурные решения помогают защитить данные и компоненты системы. Разберём практический кейс: усилим архитектуру ИИ-агента с помощью механизмов защиты, проверки данных и управления доступом. Урок пройдет в преддверие старта курса «ИИ-архитектор». Он будет полезен архитекторам ПО, разработчикам, специалистам по инфраструктуре и безопасности, которые проектируют или внедряют ИИ-решения: https://otus.pw/newu/?erid=2W5zFGJGC8R Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.
1 191
7
Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle По данным Financial Times, Tencent арендовала у Orac+1
Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle По данным Financial Times, Tencent арендовала у Oracle около 100 000 передовых ИИ-чипов на 5 лет. Сумма сделки около 7 млрд долларов, то есть примерно 14 000 долларов за чип в год. Сами чипы в Китай не попадают. Они стоят в нескольких дата-центрах Oracle в Юго-Восточной Азии, а Tencent получает к ним доступ удалённо. Формально это законно. Экспортный контроль США регулирует, куда физически уезжают чипы, а аренда вычислительных мощностей из-за рубежа под ограничения не попадает. Получается, что ограничения на поставки чипов для китайских компаний во многом работают только на бумаге: железо остаётся за пределами Китая, а модели на нём обучает китайский бигтех. Так что регуляторам, скорее всего, придётся заняться и облачной арендой. https://www.ft.com/content/8799b33d-f07c-4a03-82f0-bf5d3d1d29e9
1 841
8
Полезный совет для MySQL 8: используй LATERAL, когда для каждой строки нужно получить «лучшие N связанных записей». Например, взять последние 3 заказа каждого пользователя: SELECT u.id, u.name, o.id AS order_id, o.created_at FROM users u JOIN LATERAL ( SELECT id, created_at FROM orders WHERE orders.user_id = u.id ORDER BY created_at DESC LIMIT 3 ) o ON TRUE; Без LATERAL такую задачу часто решают через оконные функции и сначала ранжируют всю таблицу orders. С LATERAL база может для каждого пользователя сразу сходить по индексу: CREATE INDEX idx_orders_user_created ON orders (user_id, created_at DESC); Особенно полезно для задач вида: «последние N», «самая дорогая запись», «ближайшее событие», «лучший результат для каждой строки». Главное: всегда проверяй EXPLAIN ANALYZE — на больших таблицах правильный составной индекс здесь решает всё.
1 967
9
🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее? 6 октября в Архитектурном клубе Яндекс 360 разберут архитек
🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее? 6 октября в Архитектурном клубе Яндекс 360 разберут архитектуру ИИ-агента над корпоративными данными. В том числе поговорят о поиске, метаданных и фильтрах, а главное — о том, как наследовать права доступа исходных систем. Также Даниил Смирнов, руководитель разработки ИИ-платформы Яндекс 360, расскажет, как изолировать данные пользователей и организаций и не допускать утечек через индекс или кэш.. 🗓 6 октября, 17:00 МСК 💻 Онлайн, бесплатно → Зарегистрироваться на эфир
1 952
10
🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен. sqlite-vec добавляет vector search прямо в SQLit
🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен. sqlite-vec добавляет vector search прямо в SQLite через компактное расширение. Что это даёт: - без Pinecone - без Weaviate - без Qdrant - без отдельного vector DB сервера - всё хранится рядом с обычными данными в SQLite Расширение маленькое, open source и запускается везде, где работает SQLite. Для локальных AI-приложений, RAG, embedded-сценариев и небольших сервисов это особенно интересно: одна база, один файл, обычный SQL + поиск по эмбеддингам. https://github.com/asg017/sqlite-vec
2 309
11
Для чего используется команда ANALYZE в PostgreSQL?
2 302
12
🔥Полноценный data stack внутри своего контура Когда данных становится много, одного SQL-движка или отдельной СУБД уже недост
🔥Полноценный data stack внутри своего контура Когда данных становится много, одного SQL-движка или отдельной СУБД уже недостаточно. Нужна связка инструментов, которая закрывает весь путь данных: от загрузки и хранения до обработки, аналитики и визуализации. Такой сценарий можно реализовать в Stackland - платформе, которая разворачивается локально в контуре компании. В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу: 🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL - хранение и обработка данных. 🔹 Yandex Managed Service for Trino + Yandex Object Storage - основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним. 🔹 Managed Service for Apache Airflow® - управление оркестратором потоков операций по обработке данных. 🔹 Yandex DataLens - BI-система для визуализации данных. При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании. Для data engineering-команд такой подход интересен прежде всего тем, что можно собрать под одной платформой основные компоненты современного data stack: Storage → SQL → ETL/ELT → DWH/аналитика → BI И не тратить время на самостоятельную сборку и поддержку каждого компонента с нуля.
2 129
13
⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети? Команда docker run -p 5432:5432 ... по умолчанию публикует
⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети? Команда docker run -p 5432:5432 ... по умолчанию публикует порт на всех сетевых интерфейсах хоста. На Linux правило UFW, закрывающее порт, может не помочь: Docker направляет трафик к контейнеру до обработки правил UFW. Если доступ нужен только с самого сервера, укажите адрес явно: docker run -p 127.0.0.1:5432:5432 ... Для всех контейнеров можно изменить адрес привязки по умолчанию в настройках Docker. Но самый простой способ избежать сюрприза - всегда проверять, на каком адресе опубликован порт. Документация Docker - https://docs.docker.com/engine/network/port-publishing/
2 131
14
💀 Claude Code за 103 секунды удалил более 48 тысяч файлов Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент я
💀 Claude Code за 103 секунды удалил более 48 тысяч файлов Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент якобы удалил 48 218 файлов рабочего проекта и уничтожил часть Git-репозитория. Что произошло: - агенту поручили пересобрать mirror проекта; - он написал Python-скрипт для удаления старой копии; - в Windows-каталоге находились directory junctions, ведущие обратно в рабочее дерево; - проверка ссылок сработала не так, как ожидалось; - скрипт начал удалять уже реальные файлы проекта. В результате были очищены .git/objects, refs и logs, поэтому восстановление через обычный Git оказалось невозможно. Checkpoint Claude Code здесь не обязательно спасает, потому что изменения, сделанные через Bash/PowerShell, могут не попадать в механизм rewind. Источник: https://cybersecuritynews.com/claude-code-agent-file-deletion/
2 797
15
Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL? Google представила PostgreSQL for agents в
Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL? Google представила PostgreSQL for agents в AlloyDB. Когда нагрузка растёт, система за секунды запускает изолированные экземпляры базы для агентов. Они получают доступ на чтение к актуальным данным, но не конкурируют за вычислительные ресурсы с основной базой. После работы экземпляры масштабируются до нуля. Агентам доступны SQL, индексы, векторный и полнотекстовый поиск. Идея в том, чтобы они могли исследовать свежие данные и выполнять множество запросов, не замедляя транзакции пользователей. Статус: Preview, доступ предоставляется по запросу. Анонс Google Cloud - https://cloud.google.com/blog/products/databases/announcing-postgresql-for-agents-in-alloydb
3 346
16
Softmax простыми словами: что значат 66,5% в ответе нейросети? Softmax простыми словами: ChatGPT выдаёт не ответы, а вероятно
Softmax простыми словами: что значат 66,5% в ответе нейросети? Softmax простыми словами: ChatGPT выдаёт не ответы, а вероятности следующих токенов, и 66,5% означают только то, что такое продолжение текста самое вероятное. Модель может звучать уверенно и при этом ошибаться, потому что вероятность токена это не вероятность правды. Разбираем на деле Киры, как проверять ответы ИИ через источники и контекст.
3 013
17
🔥Один слой данных вместо цепочки копий между системами В традиционной аналитической инфраструктуре результаты обработки приходится переносить между хранилищем, SQL-системой и BI. Вместе с каждой копией появляется новая задача: ее нужно обновлять, сверять с исходными данными и учитывать в правилах доступа. В DataLens Platform разные инструменты работают с общей основой данных. Lakehouse построен на S3 и Apache Iceberg. Trino используется для интерактивных SQL-запросов, Spark — для ресурсоемкой обработки, Airflow — для управления процессами. Единый каталог метаданных показывает происхождение данных и их использование. Общая модель доступа действует на уровне всей платформы. Так компания сокращает количество переносов между системами, а результаты подготовки данных можно повторно использовать в SQL-запросах, отчетах и ИИ-сценариях. 📎 Подробнее о DataLens Platform — в материале СМИ.
2 642
18
⚡️ SQL-задача с опасным подвохом Какой баланс получит аккаунт после выполнения запроса в PostgreSQL? CREATE TABLE accounts ( id int PRIMARY KEY, balance int ); CREATE TABLE operations ( account_id int, amount int ); INSERT INTO accounts VALUES (1, 100); INSERT INTO operations VALUES (1, 10), (1, 20); UPDATE accounts a SET balance = a.balance + o.amount FROM operations o WHERE o.account_id = a.id; Многие ответят 130, но PostgreSQL обновит строку только один раз. Результатом может стать 110 или 120. Если целевая строка соединяется с несколькими строками из FROM, PostgreSQL использует одну из них, но какую именно, не гарантируется. Правильный вариант: UPDATE accounts a SET balance = a.balance + x.total FROM ( SELECT account_id, SUM(amount) AS total FROM operations GROUP BY account_id ) x WHERE x.account_id = a.id; Теперь каждой строке accounts соответствует ровно одна строка источника, а баланс станет 130. #SQL #PostgreSQL #Database
2 386
19
🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - семейство из трёх небольших аудиоязык+1
🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - семейство из трёх небольших аудиоязыковых моделей для работы на мобильных устройствах: Samsone-99M, Samsone-134M и Samsone-356M. Проект будет участвовать в конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее. Модели принимают один или несколько аудиофрагментов вместе с текстовым запросом и отвечают текстом: описывают звук, отвечают на вопросы о записи, сравнивают клипы между собой. Заявлено понимание речи, музыки и звуки окружения. Отвечают модели только по-английски и строчными буквами - ради экономии параметров оставили в обучающих текстах только строчные символы ASCII и вычистили из словаря редкие токены. Авторы предупреждают, что после дообучения на аудиовопросах модели теряют общие языковые навыки, так что это точечный инструмент, а не полноценный собеседник. 🟡Архитектура Аудиоэнкодер Whisper-Tiny на 9 млн параметров, нелинейный проектор в пространство текстовых эмбеддингов и языковая модель SmolLM2 от Hugging Face на 135 или 360 млн параметров. Каждый клип усредняется до 50 аудиотокенов, а разделитель SEP отделяет клипы друг от друга и от текста, поэтому аудио можно вставлять в любое место запроса. 🟡Тесты На MMAU (10 тысяч вопросов о звуках, музыке и речи) Samsone-134M набирает 61,33% против 53,34% у прежнего лидера среди малых моделей Mellow на 167 млн параметров. Это выше Qwen2-Audio-Instruct на 8,4 млрд параметров (57,4%) и на уровне Audio Flamingo 2 на 3 млрд (61,06%). На речевой части результаты хуже. В более сложном MMAU-Pro расзница с Mellow составляет 10 пп (37,57% против 27,5%), здесь впереди Qwen2-Audio (45,41%) и GPT-4o Audio (52,5%). На Galaxy S25 Ultra без аппаратных оптимизаций Samsone-99M генерирует 125 токенов в секунду, Samsone-134M - 87, Samsone-356M - 39. Обработка аудио перед генерацией занимает от 0,7 до 1,1 секунды. Веса для PyTorch, код обучения и экспорта, а также Android-приложение под Android 12 и новее выложены в репозитории проекта. 🟡Веса 🟡Arxiv 🖥GitHub @ai_machinelearning_big_data #AI #ML #SALM #Samsone #Samsung
2 131
20
Объектное хранилище в эпоху быстрых данных Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже
Объектное хранилище в эпоху быстрых данных Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже не хватает для задач ИИ и аналитики. Большие объёмы данных нужно не только хранить, но и быстро записывать и читать. В MWS Cloud Platform мы построили объектное хранилище не только на привычных HDD-дисках, но и на NVMe. На вебинаре покажем, какие сценарии работы это открывает и как меняет привычные подходы. Подключайтесь! Обсудим: ✅ Чем классы хранения MWS Object Storage отличаются от привычных ✅ В каких сценариях новый тёплый класс проявляет себя лучше всего ✅ Преимущества и слабые места в разных сценариях работы 📆 7 октября в 14:00 (мск) Зарегистрироваться
2 365