ar
Feedback
Ivan Begtin

Ivan Begtin

الذهاب إلى القناة على Telegram

I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc. CTO&Founder of Dateno https://dateno.io Telegram @ibegtin Facebook - https://facebook.com/ibegtin Email ivan@begtin.tech Ads/promotion agent: @k0shk

إظهار المزيد
9 124
المشتركون
+124 ساعات
-37 أيام
-2530 أيام

جاري تحميل البيانات...

جذب المشتركين
سبتمبر '26
سبتمبر '26
+11
في 1 قنوات
أغسطس '26
+77
في 4 قنوات
Get PRO
يوليو '26
+84
في 3 قنوات
Get PRO
يونيو '26
+219
في 18 قنوات
Get PRO
مايو '26
+40
في 6 قنوات
Get PRO
أبريل '26
+76
في 5 قنوات
Get PRO
مارس '26
+97
في 12 قنوات
Get PRO
فبراير '26
+86
في 5 قنوات
Get PRO
يناير '26
+93
في 8 قنوات
Get PRO
ديسمبر '25
+70
في 7 قنوات
Get PRO
نوفمبر '25
+65
في 6 قنوات
Get PRO
أكتوبر '25
+71
في 11 قنوات
Get PRO
سبتمبر '25
+45
في 6 قنوات
Get PRO
أغسطس '25
+105
في 8 قنوات
Get PRO
يوليو '25
+93
في 15 قنوات
Get PRO
يونيو '25
+109
في 12 قنوات
Get PRO
مايو '25
+148
في 23 قنوات
Get PRO
أبريل '25
+290
في 15 قنوات
Get PRO
مارس '25
+1 125
في 9 قنوات
Get PRO
فبراير '25
+134
في 7 قنوات
Get PRO
يناير '25
+142
في 15 قنوات
Get PRO
ديسمبر '24
+98
في 21 قنوات
Get PRO
نوفمبر '24
+87
في 10 قنوات
Get PRO
أكتوبر '24
+50
في 7 قنوات
Get PRO
سبتمبر '24
+57
في 6 قنوات
Get PRO
أغسطس '24
+81
في 9 قنوات
Get PRO
يوليو '24
+101
في 16 قنوات
Get PRO
يونيو '24
+76
في 11 قنوات
Get PRO
مايو '24
+73
في 9 قنوات
Get PRO
أبريل '24
+91
في 18 قنوات
Get PRO
مارس '24
+162
في 31 قنوات
Get PRO
فبراير '24
+144
في 28 قنوات
Get PRO
يناير '24
+106
في 10 قنوات
Get PRO
ديسمبر '23
+160
في 22 قنوات
Get PRO
نوفمبر '23
+139
في 9 قنوات
Get PRO
أكتوبر '23
+127
في 5 قنوات
Get PRO
سبتمبر '23
+153
في 0 قنوات
Get PRO
أغسطس '23
+128
في 0 قنوات
Get PRO
يوليو '23
+97
في 0 قنوات
Get PRO
يونيو '23
+101
في 0 قنوات
Get PRO
مايو '23
+305
في 0 قنوات
Get PRO
أبريل '23
+675
في 0 قنوات
Get PRO
مارس '23
+241
في 0 قنوات
Get PRO
فبراير '23
+181
في 0 قنوات
Get PRO
يناير '23
+210
في 0 قنوات
Get PRO
ديسمبر '22
+216
في 0 قنوات
Get PRO
نوفمبر '22
+233
في 0 قنوات
Get PRO
أكتوبر '22
+166
في 0 قنوات
Get PRO
سبتمبر '22
+347
في 0 قنوات
Get PRO
أغسطس '22
+261
في 0 قنوات
Get PRO
يوليو '22
+229
في 0 قنوات
Get PRO
يونيو '22
+169
في 0 قنوات
Get PRO
مايو '22
+157
في 0 قنوات
Get PRO
أبريل '22
+223
في 0 قنوات
Get PRO
مارس '22
+897
في 0 قنوات
Get PRO
فبراير '22
+163
في 0 قنوات
Get PRO
يناير '22
+203
في 0 قنوات
Get PRO
ديسمبر '21
+205
في 0 قنوات
Get PRO
نوفمبر '21
+176
في 0 قنوات
Get PRO
أكتوبر '21
+102
في 0 قنوات
Get PRO
سبتمبر '21
+737
في 0 قنوات
Get PRO
أغسطس '21
+136
في 0 قنوات
Get PRO
يوليو '21
+64
في 0 قنوات
Get PRO
يونيو '21
+89
في 0 قنوات
Get PRO
مايو '21
+70
في 0 قنوات
Get PRO
أبريل '21
+482
في 0 قنوات
Get PRO
مارس '21
+129
في 0 قنوات
Get PRO
فبراير '21
+321
في 0 قنوات
Get PRO
يناير '21
+351
في 0 قنوات
Get PRO
ديسمبر '20
+3 876
في 0 قنوات
التاريخ
نمو المشتركين
الإشارات
القنوات
05 سبتمبر+1
04 سبتمبر+1
03 سبتمبر+4
02 سبتمبر+3
01 سبتمبر+2
منشورات القناة
Я сегодня доделал очередной большой апдейт реестра каталогов данных Dateno, там теперь 29 816 каталогов данных. Это уже больше чем вдвое того что было месяц назад - 14 436. Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов. Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных. На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать. Геоданные: 1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное. 2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки. 3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже. 4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть. Статистика: 5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением). 6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов. 7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных #opendata #datacatalogs #datasets #thoughts

2
🏛️ У «Алисы AI» могут появиться расширенные права на мобильных устройствах 🔸В Минцифры обсуждают доработку правил предустановки отечественных приложений на ввозимые в Россию устройства. В частности, расширяются требования, касающиеся российского браузера «Яндекс» и умного ИИ-помощника компании — «Алиса AI». Об этом “Ъ” рассказал источник, знакомый с ходом обсуждения инициативы, и подтвердил собеседник в крупной ИТ-компании. Обсуждения проекта проходили в конце августа. 🔸ИИ-помощник «Яндекса» может получить доступ к банковским приложениям на устройствах и другим, собирающим чувствительные данные, а хранить их на своих мощностях, добавляет собеседник “Ъ”. Изменения затрагивают не только смартфоны и планшеты, но и, например, колонки, оснащенные умными помощниками (Siri от Apple, Alexa от Amazon и Google Assistant). 🔸В начале августа Минцифры уже размещало для общественного обсуждения проект постановления, который обновляет действующие правила предустановки и вводит требование о предоставлении пользователю выбора системного помощника «при первом включении гаджета», писал «Интерфакс». Однако позже документ с портала правовых актов был удален и сейчас, по данным “Ъ”, дорабатывается. 🔸В частности, разрабатывается мера по предустановке «системного помощника ИИ, созданного на базе суверенных или национальных фундаментальных моделей ИИ». Такие типы моделей закреплены в принятом в июле законе «О поддержке развития искусственного интеллекта в РФ». Однако, указывают источники “Ъ”, инициатива прямо направлена на ограничения в России аналогичных зарубежных умных помощников, а также ИИ-моделей. 👁 PA | 💬 Max | ❤️ ЯМ | 🗣️ ВК
816
3
Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных. Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам. Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция. Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично. В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично. #opendata #datacatalogs #data
1 168
4
В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ». В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров. Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах. Телевизионная часть дебатов стартует 31 августа, полное расписание известно: Первый канал 31 августа 7:05-7:45 1 сентября 7:05-7:45 2 сентября 7:05-7:45 3 сентября 7:05-7:45 4 сентября 7:05-7:45 7 сентября 7:05-7:45 8 сентября 7:05-7:45 9 сентября 7:05-7:45 10 сентября 7:05-7:45 11 сентября 7:05-7:45 Россия 1 1 сентября 23:30-0:45 2 сентября 23:30-0:45 3 сентября 23:30-0:45 8 сентября 23:30-0:45 9 сентября 23:30-0:45 Россия 24 1 сентября 19:00-20:00 2 сентября 19:00-20:00 3 сентября 19:00-20:00 8 сентября 19:00-20:00 9 сентября 19:00-20:00 10 сентября 19:00-20:00 ТВ Центр 1 сентября 17:00-17:50 2 сентября 17:00-17:50 7 сентября 17:00-17:50 8 сентября 17:00-17:50 9 сентября 17:00-17:50 10 сентября 17:00-17:50 ОТР 31 августа 10:00-11:00 2 сентября 10:00-11:00 4 сентября 10:00-11:00 7 сентября 10:00-11:00 9 сентября 10:00-11:00 11 сентября 10:00-11:00 Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat. #archives #elections #helpneeded
968
5
Научные данные России: с чего начинать Земля, океан, климат ЕСИМО — http://esimo.ru  Тема: океан, метеорология, гидрология.  Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив. Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html  Тема: метеорология.  Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД). Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/  Тема: климат, солнечная радиация.  Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова. Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html  Тема: геофизика, космос.  Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН. Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/  Тема: геомагнетизм.  Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS). Астрономия и физика Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/  Тема: астрономия.  Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии. SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml  Тема: атомная спектроскопия, физика плазмы.  Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения. Биоразнообразие и коллекции Российский GBIF IPT — http://gbif.ru:8080/ipt/  Тема: биоразнообразие.  Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша). «Ноев ковчег», МГУ — https://depo.msu.ru/ipt/  Тема: живые системы, биоматериалы.  Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF. IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru  Тема: зоология и ботаника.  Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН. IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/  Тема: морская биология.  Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН. Молекулярная биология (российские базы мирового уровня) CSDB — https://csdb.glycoscience.ru/database/  Тема: гликомика.  Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН). GTRD — https://gtrd.biouml.org/  Тема: регуляция транскрипции.  Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши. HOCOMOCO — https://hocomoco11.autosome.org/  Тема: геномика, мотивы ДНК.  Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD). VDJdb — https://vdjdb.com/  Тема: иммунология, TCR.  Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН). EpiFactors — https://epifactors.autosome.org/  Тема: эпигенетика.  Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ). Медицина и ML MosMedData — https://mosmed.ai/datasets  Тема: медицинская визуализация.  Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей. Medical Data Hub — https://medicaldatahub.ru/datasets/  Тема: медицинские датасеты для ML.  Ценность: каталог медицинских наборов под машинное обучение. Гуманитаристика, соцнауки, вузы Dataverse Пушкинского Дома — https://dataverse.pushdom.ru  Тема: русская литература и фольклор.  Ценность: открытые исследовательские данные ИРЛИ РАН с DOI. Репозиторий психологических данных — https://ruspsydata.figshare.com  Тема: психология.  Ценность: данные и инструменты исследований МГППУ. DSpace СПбГУ — https://dspace.spbu.ru  Тема: университетский репозиторий.  Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7). #opendata #datasets #russia #researchdata
1 056
6
Полезные ссылки про данные, технологии и не только: - Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом - ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna #dataengineering #aiagents
865
7
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную ста
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны. В чем их особенности: - как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку - большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю. - всегда акцент на визуализации, то что национальные статслужбы не умеют - но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко. Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов. Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность. #opendata #datasets #datacatalogs #datavis #statistics
860
8
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет+1
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее. Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее. #opendata #ai #india #datacatalogs #datasets
1 005
9
В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года. Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы. Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска". Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют. #opendata #russia #datacatalogs
890
10
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинн
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet. При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо. Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд. Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо. Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию. Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат. #opendata #datacatalogs #datasets #geodata
881
11
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии. Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области. Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д. #opendata #USA #genomic #datasets
821
12
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az Включает 836 наборов данных от 2
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде. Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c) #opendata #datasets #datacatalogs
938
13
Хотите больших, очень больших, очень-очень больших данных? 2 петабайта архив за 2024 год проекта End of Term Web Archive по архивации деятельности правительства США. Делают они его в партнерстве с Internet Archive, которые обеспечивают техническую часть организации архивации. А сами данные хранятся на AWS в рамках спонсорского гранта от Amazon. Просмотреть сохраненные сайты можно на сайте GovArchive.us #webarchives #data #datasets #USA
1 015
14
Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов. Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.). Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения. Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут. При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила. Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей. К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств. Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith. Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее. #thoughts #ai #datacatalogs
869
15
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и 21856 файлов на 25 августа 2026 г. Раньше их портал работал на базе движка CKAN, теперь там какой-то собственный движок, так что автоматически быстро не проверить объёмы данных и содержимое по типам и тд. Практически все данные это статистика и административные реестры (перечни предприятий, организаций и тд.). Форматы CSV, JSON, XLSX. Нет общедоступного API и в целом выглядит как каталог данных для начальства, потому что уж очень сильно статистика выпячена на главной, явно чтобы показать масштабы и востребованность. Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден. #opendata #data #datasets #datacatalogs #mongolia
981
16
Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспольз
Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу. И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше. #ai #datatools
956
17
OECD AIS Report визуализация данных о морских перевозках от ОЭСР. Плюсы: - наглядная визуализация на карте и в графиках - дет
OECD AIS Report визуализация данных о морских перевозках от ОЭСР. Плюсы: - наглядная визуализация на карте и в графиках - детализация данных до портов и перевозимых продуктов по типам - относительно небольшой лаг в 3 месяца (в августе данные на май 2026г.) Минусы: - нет нормально доступных данных, только экспорт выборок в Excel - не все страны есть, к примеру есть данные по России и нет данных по США - все таки 3 месяца это большой лаг, для оперативного анализа Что хорошо, можно легко автоматизировать выгрузку данных даже если там только Excel и тд. Недокументированное API тоже есть. #opendata #datasets #oecd
904
18
Ещё немного рассуждений вслух про то как публикуются данные в мире сейчас: 1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных. 2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных. 3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.) 4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран 5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов. 6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры. 7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов. 8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков. #thoughts #data #datacatalogs
851
19
Из коллекции Цифрового архива: «Государственный бюджет СССР и бюджеты союзных республик 1950, 1955, 1960–1965 гг. Статистичес
Из коллекции Цифрового архива: «Государственный бюджет СССР и бюджеты союзных республик 1950, 1955, 1960–1965 гг. Статистический сборник», Москва, 1966 г. Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов. Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных. В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания. Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов. Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности. Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят: • Доходы республики (в млн. рублей). • Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат. • Структура расходов в процентах и аналогичная группировка по видам затрат. • Распределение расходов по видам местных бюджетов. Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР. Аналогичные по структуре и наполнению справочники есть для следующих периодов: • 1966–1970 гг. • 1971–1975 гг. • 1976–1980 гг. • 1981–1985 гг. При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат. Справочники можно скачать на сайте Цифрового архива: • Годы 1950, 1955, 1960–1965 • Годы 1960, 1965, 1966–1970 • Годы 1966–1970, 1971–1975 • Годы 1971–1975, 1976– 1980 • Годы 1976–1980, 1981–1985 В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников. #бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика
683
20
В рубрике как это устроено у них свежие порталы открытых данных африканских стран Того - https://opendata.gouv.tg Работает на+1
В рубрике как это устроено у них свежие порталы открытых данных африканских стран Того - https://opendata.gouv.tg Работает на базе ПО uData, французского open source проекта. Содержит более 1500 наборов данных. Преимущественно в формате CSV и много геоданных Ливия - https://opendata.gia.gov.ly/ Работает на базе открытого ПО CKAN. Включает 129 наборов данных. В основном это файлы Excel, некоторые статпоказатели также публикуют в CSV и JSON #opendata #datasets #data #libya #togo #africa
977