en
Feedback
Ivan Begtin

Ivan Begtin

Open in Telegram

I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc. CTO&Founder of Dateno https://dateno.io Telegram @ibegtin Facebook - https://facebook.com/ibegtin Email ivan@begtin.tech Ads/promotion agent: @k0shk

Show more
9 121
Subscribers
+124 hours
-17 days
-2630 days
Attracting Subscribers
September '26
September '26
+12
in 1 channels
August '26
+77
in 4 channels
Get PRO
July '26
+84
in 3 channels
Get PRO
June '26
+219
in 18 channels
Get PRO
May '26
+40
in 6 channels
Get PRO
April '26
+76
in 5 channels
Get PRO
March '26
+97
in 12 channels
Get PRO
February '26
+86
in 5 channels
Get PRO
January '26
+93
in 8 channels
Get PRO
December '25
+70
in 7 channels
Get PRO
November '25
+65
in 6 channels
Get PRO
October '25
+71
in 11 channels
Get PRO
September '25
+45
in 6 channels
Get PRO
August '25
+105
in 8 channels
Get PRO
July '25
+93
in 15 channels
Get PRO
June '25
+109
in 12 channels
Get PRO
May '25
+148
in 23 channels
Get PRO
April '25
+290
in 15 channels
Get PRO
March '25
+1 125
in 9 channels
Get PRO
February '25
+134
in 7 channels
Get PRO
January '25
+142
in 15 channels
Get PRO
December '24
+98
in 21 channels
Get PRO
November '24
+87
in 10 channels
Get PRO
October '24
+50
in 7 channels
Get PRO
September '24
+57
in 6 channels
Get PRO
August '24
+81
in 9 channels
Get PRO
July '24
+101
in 16 channels
Get PRO
June '24
+76
in 11 channels
Get PRO
May '24
+73
in 9 channels
Get PRO
April '24
+91
in 18 channels
Get PRO
March '24
+162
in 31 channels
Get PRO
February '24
+144
in 28 channels
Get PRO
January '24
+106
in 10 channels
Get PRO
December '23
+160
in 22 channels
Get PRO
November '23
+139
in 9 channels
Get PRO
October '23
+127
in 5 channels
Get PRO
September '23
+153
in 0 channels
Get PRO
August '23
+128
in 0 channels
Get PRO
July '23
+97
in 0 channels
Get PRO
June '23
+101
in 0 channels
Get PRO
May '23
+305
in 0 channels
Get PRO
April '23
+675
in 0 channels
Get PRO
March '23
+241
in 0 channels
Get PRO
February '23
+181
in 0 channels
Get PRO
January '23
+210
in 0 channels
Get PRO
December '22
+216
in 0 channels
Get PRO
November '22
+233
in 0 channels
Get PRO
October '22
+166
in 0 channels
Get PRO
September '22
+347
in 0 channels
Get PRO
August '22
+261
in 0 channels
Get PRO
July '22
+229
in 0 channels
Get PRO
June '22
+169
in 0 channels
Get PRO
May '22
+157
in 0 channels
Get PRO
April '22
+223
in 0 channels
Get PRO
March '22
+897
in 0 channels
Get PRO
February '22
+163
in 0 channels
Get PRO
January '22
+203
in 0 channels
Get PRO
December '21
+205
in 0 channels
Get PRO
November '21
+176
in 0 channels
Get PRO
October '21
+102
in 0 channels
Get PRO
September '21
+737
in 0 channels
Get PRO
August '21
+136
in 0 channels
Get PRO
July '21
+64
in 0 channels
Get PRO
June '21
+89
in 0 channels
Get PRO
May '21
+70
in 0 channels
Get PRO
April '21
+482
in 0 channels
Get PRO
March '21
+129
in 0 channels
Get PRO
February '21
+321
in 0 channels
Get PRO
January '21
+351
in 0 channels
Get PRO
December '20
+3 876
in 0 channels
Date
Subscriber Growth
Mentions
Channels
07 September0
06 September+1
05 September+1
04 September+1
03 September+4
02 September+3
01 September+2
Channel Posts
В качестве напоминания сайт Национального цифрового архива РФ ruarxive.org одновременно является базой знаний о том как архивировать сайты, социальные сети и другие digital born объекты и там же есть инструкции и гайды о том как с этими архивами работать. Обратная связь всячески приветствуется и если Вы видите что там чего-то нехватает, напишите, это там появится. #digitalpreservation #webarchives

2
В рубрике [частично] доступных российских геоданных Восемь российских геопорталов, на которые стоит обратить внимание: • Геопортал РГО открывает доступ к историческим картам, атласам и планам из собрания Русского географического общества — более 48 тысяч уникальных материалов. • Геопортал Мордовии объединяет тематические карты населённых пунктов, районов, охраняемых территорий, оползней, религиозных объектов и туристической инфраструктуры. • Геопортал «Кадастрсъёмки» содержит ортофотопланы, топографические и кадастровые материалы, данные инженерных изысканий и мониторинга дорог по регионам Восточной Сибири. • Интерактивные карты Сургута — муниципальная галерея карт городской инфраструктуры, избирательных округов и различных городских служб. • Муниципальная ГИС Красноярска позволяет изучать генплан, территориальное зонирование, земельные торги, дороги, парки, водные объекты и кадастровую информацию. • Инфокарта Екатеринбурга — общественный проект с данными о возрасте, высоте и состоянии зданий, объектах культурного наследия, ДТП и туристических маршрутах. • Веб-ГИС Дагестанского заповедника публикует границы охраняемых территорий, фотопланы и материалы мониторинга природных пожаров. • Веб-ГИС заказника «Степной» посвящена охраняемой территории в Астраханской области: здесь доступны веб-карты, снимки и данные пожарного мониторинга. #opendata #geodata #datasets #russia
602
3
В рубрике открытых российских данных портал по биоразнообразию Северной части Западной Сибири bioportal.ugrasu.ru Создан в Юг+1
В рубрике открытых российских данных портал по биоразнообразию Северной части Западной Сибири bioportal.ugrasu.ru Создан в Югорском государственном университете вначале на грант Евросоюза и далее за счет Президентского гранта. Работает на базе ПО Specify платформе с открытым кодом для собственного или облачного хостинга. В мире не меньше десятка отдельных инсталляций этого продукта и несколько десятков участвующих организаций. А также эти данные публикуются на портале GBIF как отдельные датасеты. #datacatalogs #datasets #russia #opendata #biology
564
4
В рубрике как это устроено у них data.museum.wa.gov.au портал открытых данных Музея Западной Австралии. Наборов данных там не
В рубрике как это устроено у них data.museum.wa.gov.au портал открытых данных Музея Западной Австралии. Наборов данных там немного, сделан он на базе DKAN ПО с открытым кодом для публикации открытых данных и совместимое с CKAN по основному своему API. В отличие от CKAN он устроен проще и легче в развертывании, а также основан на Drupal в отличии от более комплексного CKAN написанного на Python. Этот портал один из редких порталов открытых данных музеев, а сами наборы данных описывают их экспозиции. Другие примеры музеев публикующих открытые данные: - API Пушкинского музея в России - API Rijks Museum в Голландии - Данные Natural History Museum в Великобритании И многие другие. Как-нибудь сделаю небольшой обзор. #opendata #museums #australia #datacatalogs
591
5
Я сегодня доделал очередной большой апдейт реестра каталогов данных Dateno, там теперь 29 816 каталогов данных. Это уже больше чем вдвое того что было месяц назад - 14 436. Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов. Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных. На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать. Геоданные: 1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное. 2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки. 3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже. 4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть. Статистика: 5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением). 6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов. 7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных #opendata #datacatalogs #datasets #thoughts
959
6
🏛️ У «Алисы AI» могут появиться расширенные права на мобильных устройствах 🔸В Минцифры обсуждают доработку правил предустановки отечественных приложений на ввозимые в Россию устройства. В частности, расширяются требования, касающиеся российского браузера «Яндекс» и умного ИИ-помощника компании — «Алиса AI». Об этом “Ъ” рассказал источник, знакомый с ходом обсуждения инициативы, и подтвердил собеседник в крупной ИТ-компании. Обсуждения проекта проходили в конце августа. 🔸ИИ-помощник «Яндекса» может получить доступ к банковским приложениям на устройствах и другим, собирающим чувствительные данные, а хранить их на своих мощностях, добавляет собеседник “Ъ”. Изменения затрагивают не только смартфоны и планшеты, но и, например, колонки, оснащенные умными помощниками (Siri от Apple, Alexa от Amazon и Google Assistant). 🔸В начале августа Минцифры уже размещало для общественного обсуждения проект постановления, который обновляет действующие правила предустановки и вводит требование о предоставлении пользователю выбора системного помощника «при первом включении гаджета», писал «Интерфакс». Однако позже документ с портала правовых актов был удален и сейчас, по данным “Ъ”, дорабатывается. 🔸В частности, разрабатывается мера по предустановке «системного помощника ИИ, созданного на базе суверенных или национальных фундаментальных моделей ИИ». Такие типы моделей закреплены в принятом в июле законе «О поддержке развития искусственного интеллекта в РФ». Однако, указывают источники “Ъ”, инициатива прямо направлена на ограничения в России аналогичных зарубежных умных помощников, а также ИИ-моделей. 👁 PA | 💬 Max | ❤️ ЯМ | 🗣️ ВК
1 018
7
Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных. Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам. Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция. Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично. В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично. #opendata #datacatalogs #data
1 234
8
В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ». В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров. Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах. Телевизионная часть дебатов стартует 31 августа, полное расписание известно: Первый канал 31 августа 7:05-7:45 1 сентября 7:05-7:45 2 сентября 7:05-7:45 3 сентября 7:05-7:45 4 сентября 7:05-7:45 7 сентября 7:05-7:45 8 сентября 7:05-7:45 9 сентября 7:05-7:45 10 сентября 7:05-7:45 11 сентября 7:05-7:45 Россия 1 1 сентября 23:30-0:45 2 сентября 23:30-0:45 3 сентября 23:30-0:45 8 сентября 23:30-0:45 9 сентября 23:30-0:45 Россия 24 1 сентября 19:00-20:00 2 сентября 19:00-20:00 3 сентября 19:00-20:00 8 сентября 19:00-20:00 9 сентября 19:00-20:00 10 сентября 19:00-20:00 ТВ Центр 1 сентября 17:00-17:50 2 сентября 17:00-17:50 7 сентября 17:00-17:50 8 сентября 17:00-17:50 9 сентября 17:00-17:50 10 сентября 17:00-17:50 ОТР 31 августа 10:00-11:00 2 сентября 10:00-11:00 4 сентября 10:00-11:00 7 сентября 10:00-11:00 9 сентября 10:00-11:00 11 сентября 10:00-11:00 Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat. #archives #elections #helpneeded
1 047
9
Научные данные России: с чего начинать Земля, океан, климат ЕСИМО — http://esimo.ru  Тема: океан, метеорология, гидрология.  Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив. Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html  Тема: метеорология.  Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД). Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/  Тема: климат, солнечная радиация.  Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова. Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html  Тема: геофизика, космос.  Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН. Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/  Тема: геомагнетизм.  Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS). Астрономия и физика Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/  Тема: астрономия.  Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии. SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml  Тема: атомная спектроскопия, физика плазмы.  Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения. Биоразнообразие и коллекции Российский GBIF IPT — http://gbif.ru:8080/ipt/  Тема: биоразнообразие.  Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша). «Ноев ковчег», МГУ — https://depo.msu.ru/ipt/  Тема: живые системы, биоматериалы.  Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF. IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru  Тема: зоология и ботаника.  Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН. IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/  Тема: морская биология.  Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН. Молекулярная биология (российские базы мирового уровня) CSDB — https://csdb.glycoscience.ru/database/  Тема: гликомика.  Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН). GTRD — https://gtrd.biouml.org/  Тема: регуляция транскрипции.  Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши. HOCOMOCO — https://hocomoco11.autosome.org/  Тема: геномика, мотивы ДНК.  Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD). VDJdb — https://vdjdb.com/  Тема: иммунология, TCR.  Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН). EpiFactors — https://epifactors.autosome.org/  Тема: эпигенетика.  Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ). Медицина и ML MosMedData — https://mosmed.ai/datasets  Тема: медицинская визуализация.  Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей. Medical Data Hub — https://medicaldatahub.ru/datasets/  Тема: медицинские датасеты для ML.  Ценность: каталог медицинских наборов под машинное обучение. Гуманитаристика, соцнауки, вузы Dataverse Пушкинского Дома — https://dataverse.pushdom.ru  Тема: русская литература и фольклор.  Ценность: открытые исследовательские данные ИРЛИ РАН с DOI. Репозиторий психологических данных — https://ruspsydata.figshare.com  Тема: психология.  Ценность: данные и инструменты исследований МГППУ. DSpace СПбГУ — https://dspace.spbu.ru  Тема: университетский репозиторий.  Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7). #opendata #datasets #russia #researchdata
1 117
10
Полезные ссылки про данные, технологии и не только: - Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом - ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna #dataengineering #aiagents
919
11
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную ста
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны. В чем их особенности: - как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку - большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю. - всегда акцент на визуализации, то что национальные статслужбы не умеют - но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко. Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов. Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность. #opendata #datasets #datacatalogs #datavis #statistics
929
12
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет+1
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее. Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее. #opendata #ai #india #datacatalogs #datasets
1 076
13
В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года. Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы. Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска". Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют. #opendata #russia #datacatalogs
926
14
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинн
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet. При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо. Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд. Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо. Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию. Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат. #opendata #datacatalogs #datasets #geodata
944
15
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии. Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области. Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д. #opendata #USA #genomic #datasets
941
16
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az Включает 836 наборов данных от 2
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде. Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c) #opendata #datasets #datacatalogs
976
17
Хотите больших, очень больших, очень-очень больших данных? 2 петабайта архив за 2024 год проекта End of Term Web Archive по архивации деятельности правительства США. Делают они его в партнерстве с Internet Archive, которые обеспечивают техническую часть организации архивации. А сами данные хранятся на AWS в рамках спонсорского гранта от Amazon. Просмотреть сохраненные сайты можно на сайте GovArchive.us #webarchives #data #datasets #USA
1 057
18
Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов. Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.). Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения. Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут. При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила. Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей. К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств. Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith. Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее. #thoughts #ai #datacatalogs
895
19
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и 21856 файлов на 25 августа 2026 г. Раньше их портал работал на базе движка CKAN, теперь там какой-то собственный движок, так что автоматически быстро не проверить объёмы данных и содержимое по типам и тд. Практически все данные это статистика и административные реестры (перечни предприятий, организаций и тд.). Форматы CSV, JSON, XLSX. Нет общедоступного API и в целом выглядит как каталог данных для начальства, потому что уж очень сильно статистика выпячена на главной, явно чтобы показать масштабы и востребованность. Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден. #opendata #data #datasets #datacatalogs #mongolia
1 033
20
Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспольз
Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу. И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше. #ai #datatools
960