Ivan Begtin
前往频道在 Telegram
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc. CTO&Founder of Dateno https://dateno.io Telegram @ibegtin Facebook - https://facebook.com/ibegtin Email ivan@begtin.tech Ads/promotion agent: @k0shk
显示更多9 123
订阅者
-124 小时
-57 天
-2530 天
数据加载中...
吸引订阅者
九月 '26
九月 '26
+11
在1个频道中
八月 '26
+77
在4个频道中
Get PRO
七月 '26
+84
在3个频道中
Get PRO
六月 '26
+219
在18个频道中
Get PRO
五月 '26
+40
在6个频道中
Get PRO
四月 '26
+76
在5个频道中
Get PRO
三月 '26
+97
在12个频道中
Get PRO
二月 '26
+86
在5个频道中
Get PRO
一月 '26
+93
在8个频道中
Get PRO
十二月 '25
+70
在7个频道中
Get PRO
十一月 '25
+65
在6个频道中
Get PRO
十月 '25
+71
在11个频道中
Get PRO
九月 '25
+45
在6个频道中
Get PRO
八月 '25
+105
在8个频道中
Get PRO
七月 '25
+93
在15个频道中
Get PRO
六月 '25
+109
在12个频道中
Get PRO
五月 '25
+148
在23个频道中
Get PRO
四月 '25
+290
在15个频道中
Get PRO
三月 '25
+1 125
在9个频道中
Get PRO
二月 '25
+134
在7个频道中
Get PRO
一月 '25
+142
在15个频道中
Get PRO
十二月 '24
+98
在21个频道中
Get PRO
十一月 '24
+87
在10个频道中
Get PRO
十月 '24
+50
在7个频道中
Get PRO
九月 '24
+57
在6个频道中
Get PRO
八月 '24
+81
在9个频道中
Get PRO
七月 '24
+101
在16个频道中
Get PRO
六月 '24
+76
在11个频道中
Get PRO
五月 '24
+73
在9个频道中
Get PRO
四月 '24
+91
在18个频道中
Get PRO
三月 '24
+162
在31个频道中
Get PRO
二月 '24
+144
在28个频道中
Get PRO
一月 '24
+106
在10个频道中
Get PRO
十二月 '23
+160
在22个频道中
Get PRO
十一月 '23
+139
在9个频道中
Get PRO
十月 '23
+127
在5个频道中
Get PRO
九月 '23
+153
在0个频道中
Get PRO
八月 '23
+128
在0个频道中
Get PRO
七月 '23
+97
在0个频道中
Get PRO
六月 '23
+101
在0个频道中
Get PRO
五月 '23
+305
在0个频道中
Get PRO
四月 '23
+675
在0个频道中
Get PRO
三月 '23
+241
在0个频道中
Get PRO
二月 '23
+181
在0个频道中
Get PRO
一月 '23
+210
在0个频道中
Get PRO
十二月 '22
+216
在0个频道中
Get PRO
十一月 '22
+233
在0个频道中
Get PRO
十月 '22
+166
在0个频道中
Get PRO
九月 '22
+347
在0个频道中
Get PRO
八月 '22
+261
在0个频道中
Get PRO
七月 '22
+229
在0个频道中
Get PRO
六月 '22
+169
在0个频道中
Get PRO
五月 '22
+157
在0个频道中
Get PRO
四月 '22
+223
在0个频道中
Get PRO
三月 '22
+897
在0个频道中
Get PRO
二月 '22
+163
在0个频道中
Get PRO
一月 '22
+203
在0个频道中
Get PRO
十二月 '21
+205
在0个频道中
Get PRO
十一月 '21
+176
在0个频道中
Get PRO
十月 '21
+102
在0个频道中
Get PRO
九月 '21
+737
在0个频道中
Get PRO
八月 '21
+136
在0个频道中
Get PRO
七月 '21
+64
在0个频道中
Get PRO
六月 '21
+89
在0个频道中
Get PRO
五月 '21
+70
在0个频道中
Get PRO
四月 '21
+482
在0个频道中
Get PRO
三月 '21
+129
在0个频道中
Get PRO
二月 '21
+321
在0个频道中
Get PRO
一月 '21
+351
在0个频道中
Get PRO
十二月 '20
+3 876
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 05 九月 | +1 | |||
| 04 九月 | +1 | |||
| 03 九月 | +4 | |||
| 02 九月 | +3 | |||
| 01 九月 | +2 |
频道帖子
Я сегодня доделал очередной большой апдейт реестра каталогов данных Dateno, там теперь 29 816 каталогов данных. Это уже больше чем вдвое того что было месяц назад - 14 436.
Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов.
Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных.
На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать.
Геоданные:
1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное.
2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки.
3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже.
4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть.
Статистика:
5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением).
6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов.
7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных
#opendata #datacatalogs #datasets #thoughts
| 2 | 🏛️ У «Алисы AI» могут появиться расширенные права на мобильных устройствах
🔸В Минцифры обсуждают доработку правил предустановки отечественных приложений на ввозимые в Россию устройства. В частности, расширяются требования, касающиеся российского браузера «Яндекс» и умного ИИ-помощника компании — «Алиса AI». Об этом “Ъ” рассказал источник, знакомый с ходом обсуждения инициативы, и подтвердил собеседник в крупной ИТ-компании. Обсуждения проекта проходили в конце августа.
🔸ИИ-помощник «Яндекса» может получить доступ к банковским приложениям на устройствах и другим, собирающим чувствительные данные, а хранить их на своих мощностях, добавляет собеседник “Ъ”. Изменения затрагивают не только смартфоны и планшеты, но и, например, колонки, оснащенные умными помощниками (Siri от Apple, Alexa от Amazon и Google Assistant).
🔸В начале августа Минцифры уже размещало для общественного обсуждения проект постановления, который обновляет действующие правила предустановки и вводит требование о предоставлении пользователю выбора системного помощника «при первом включении гаджета», писал «Интерфакс». Однако позже документ с портала правовых актов был удален и сейчас, по данным “Ъ”, дорабатывается.
🔸В частности, разрабатывается мера по предустановке «системного помощника ИИ, созданного на базе суверенных или национальных фундаментальных моделей ИИ». Такие типы моделей закреплены в принятом в июле законе «О поддержке развития искусственного интеллекта в РФ». Однако, указывают источники “Ъ”, инициатива прямо направлена на ограничения в России аналогичных зарубежных умных помощников, а также ИИ-моделей.
👁 PA | 💬 Max | ❤️ ЯМ | 🗣️ ВК | 816 |
| 3 | Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных.
Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.
Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.
Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.
В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.
#opendata #datacatalogs #data | 1 168 |
| 4 | В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ».
В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров.
Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах.
Телевизионная часть дебатов стартует 31 августа, полное расписание известно:
Первый канал
31 августа 7:05-7:45
1 сентября 7:05-7:45
2 сентября 7:05-7:45
3 сентября 7:05-7:45
4 сентября 7:05-7:45
7 сентября 7:05-7:45
8 сентября 7:05-7:45
9 сентября 7:05-7:45
10 сентября 7:05-7:45
11 сентября 7:05-7:45
Россия 1
1 сентября 23:30-0:45
2 сентября 23:30-0:45
3 сентября 23:30-0:45
8 сентября 23:30-0:45
9 сентября 23:30-0:45
Россия 24
1 сентября 19:00-20:00
2 сентября 19:00-20:00
3 сентября 19:00-20:00
8 сентября 19:00-20:00
9 сентября 19:00-20:00
10 сентября 19:00-20:00
ТВ Центр
1 сентября 17:00-17:50
2 сентября 17:00-17:50
7 сентября 17:00-17:50
8 сентября 17:00-17:50
9 сентября 17:00-17:50
10 сентября 17:00-17:50
ОТР
31 августа 10:00-11:00
2 сентября 10:00-11:00
4 сентября 10:00-11:00
7 сентября 10:00-11:00
9 сентября 10:00-11:00
11 сентября 10:00-11:00
Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat.
#archives #elections #helpneeded | 968 |
| 5 | Научные данные России: с чего начинать
Земля, океан, климат
ЕСИМО — http://esimo.ru
Тема: океан, метеорология, гидрология.
Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.
Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
Тема: метеорология.
Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).
Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
Тема: климат, солнечная радиация.
Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.
Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
Тема: геофизика, космос.
Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.
Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
Тема: геомагнетизм.
Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).
Астрономия и физика
Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
Тема: астрономия.
Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.
SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
Тема: атомная спектроскопия, физика плазмы.
Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.
Биоразнообразие и коллекции
Российский GBIF IPT — http://gbif.ru:8080/ipt/
Тема: биоразнообразие.
Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).
«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
Тема: живые системы, биоматериалы.
Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.
IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
Тема: зоология и ботаника.
Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.
IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
Тема: морская биология.
Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.
Молекулярная биология (российские базы мирового уровня)
CSDB — https://csdb.glycoscience.ru/database/
Тема: гликомика.
Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).
GTRD — https://gtrd.biouml.org/
Тема: регуляция транскрипции.
Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.
HOCOMOCO — https://hocomoco11.autosome.org/
Тема: геномика, мотивы ДНК.
Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).
VDJdb — https://vdjdb.com/
Тема: иммунология, TCR.
Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).
EpiFactors — https://epifactors.autosome.org/
Тема: эпигенетика.
Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).
Медицина и ML
MosMedData — https://mosmed.ai/datasets
Тема: медицинская визуализация.
Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.
Medical Data Hub — https://medicaldatahub.ru/datasets/
Тема: медицинские датасеты для ML.
Ценность: каталог медицинских наборов под машинное обучение.
Гуманитаристика, соцнауки, вузы
Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
Тема: русская литература и фольклор.
Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.
Репозиторий психологических данных — https://ruspsydata.figshare.com
Тема: психология.
Ценность: данные и инструменты исследований МГППУ.
DSpace СПбГУ — https://dspace.spbu.ru
Тема: университетский репозиторий.
Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).
#opendata #datasets #russia #researchdata | 1 056 |
| 6 | Полезные ссылки про данные, технологии и не только:
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents | 865 |
| 7 | Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны.
В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.
Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.
Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.
#opendata #datasets #datacatalogs #datavis #statistics | 860 |
| 8 | В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее.
Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.
#opendata #ai #india #datacatalogs #datasets | 1 005 |
| 9 | В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года.
Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.
Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".
Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.
#opendata #russia #datacatalogs | 890 |
| 10 | Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet.
При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.
Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.
Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.
Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.
Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.
#opendata #datacatalogs #datasets #geodata | 881 |
| 11 | В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии.
Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.
Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.
#opendata #USA #genomic #datasets | 821 |
| 12 | В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az
Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.
Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)
#opendata #datasets #datacatalogs | 938 |
| 13 | Хотите больших, очень больших, очень-очень больших данных? 2 петабайта архив за 2024 год проекта End of Term Web Archive по архивации деятельности правительства США. Делают они его в партнерстве с Internet Archive, которые обеспечивают техническую часть организации архивации. А сами данные хранятся на AWS в рамках спонсорского гранта от Amazon. Просмотреть сохраненные сайты можно на сайте GovArchive.us
#webarchives #data #datasets #USA | 1 015 |
| 14 | Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов.
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs | 869 |
| 15 | В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и 21856 файлов на 25 августа 2026 г. Раньше их портал работал на базе движка CKAN, теперь там какой-то собственный движок, так что автоматически быстро не проверить объёмы данных и содержимое по типам и тд. Практически все данные это статистика и административные реестры (перечни предприятий, организаций и тд.). Форматы CSV, JSON, XLSX. Нет общедоступного API и в целом выглядит как каталог данных для начальства, потому что уж очень сильно статистика выпячена на главной, явно чтобы показать масштабы и востребованность.
Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден.
#opendata #data #datasets #datacatalogs #mongolia | 981 |
| 16 | Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу.
И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.
#ai #datatools | 956 |
| 17 | OECD AIS Report визуализация данных о морских перевозках от ОЭСР.
Плюсы:
- наглядная визуализация на карте и в графиках
- детализация данных до портов и перевозимых продуктов по типам
- относительно небольшой лаг в 3 месяца (в августе данные на май 2026г.)
Минусы:
- нет нормально доступных данных, только экспорт выборок в Excel
- не все страны есть, к примеру есть данные по России и нет данных по США
- все таки 3 месяца это большой лаг, для оперативного анализа
Что хорошо, можно легко автоматизировать выгрузку данных даже если там только Excel и тд. Недокументированное API тоже есть.
#opendata #datasets #oecd | 904 |
| 18 | Ещё немного рассуждений вслух про то как публикуются данные в мире сейчас:
1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных.
2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных.
3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.)
4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран
5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов.
6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры.
7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов.
8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков.
#thoughts #data #datacatalogs | 851 |
| 19 | Из коллекции Цифрового архива: «Государственный бюджет СССР и бюджеты союзных республик 1950, 1955, 1960–1965 гг. Статистический сборник», Москва, 1966 г.
Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов.
Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных.
В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания.
Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов.
Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности.
Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят:
• Доходы республики (в млн. рублей).
• Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат.
• Структура расходов в процентах и аналогичная группировка по видам затрат.
• Распределение расходов по видам местных бюджетов.
Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР.
Аналогичные по структуре и наполнению справочники есть для следующих периодов:
• 1966–1970 гг.
• 1971–1975 гг.
• 1976–1980 гг.
• 1981–1985 гг.
При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат.
Справочники можно скачать на сайте Цифрового архива:
• Годы 1950, 1955, 1960–1965
• Годы 1960, 1965, 1966–1970
• Годы 1966–1970, 1971–1975
• Годы 1971–1975, 1976– 1980
• Годы 1976–1980, 1981–1985
В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников.
#бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика | 683 |
| 20 | В рубрике как это устроено у них свежие порталы открытых данных африканских стран
Того - https://opendata.gouv.tg
Работает на базе ПО uData, французского open source проекта. Содержит более 1500 наборов данных. Преимущественно в формате CSV и много геоданных
Ливия - https://opendata.gia.gov.ly/
Работает на базе открытого ПО CKAN. Включает 129 наборов данных. В основном это файлы Excel, некоторые статпоказатели также публикуют в CSV и JSON
#opendata #datasets #data #libya #togo #africa | 977 |
