форель разбивает лоб
Открыть в Telegram
1 847
Подписчики
Нет данных24 часа
Нет данных7 дней
Нет данных30 дней
Архив постов
1 847
кстати, о семинарах: на следующей неделе сразу два интересных, но в одно и то же время, 19 числа.
Первый сугубо очный, что своеобразно. Может, из-за деликатности темы?
1. Андрей Гуськов об академической мобильности
19 декабря 2023 г. в 15.00 состоится 195-е заседание Московского семинара по науковедению и наукометрии. С докладом «Наукометрический метод изучения академической мобильности» выступит к.т.н., заведующий лаборатории наукометрии и научных коммуникаций РИЭПП (Новосибирск) Андрей Евгеньевич Гуськов.
Мероприятие пройдет в Институте научной информации по общественным наукам Российской академии наук. Нахимовский проспект 51/21 (м. Профсоюзная). Зал заседаний Ученого Совета, 4-й этаж.
Для участия в мероприятии необходимо зарегистрироваться: naukovedinion@yandex.ru
Андрей Гуськов и Денис Косяков сейчас - придворные наукометристы Минобрнауки, и это можно только приветствовать, ибо они отличные специалисты и настоящие ученые, не то что я. Я всегда рекомендую их работы. У коллег полный дамп Скопуса (полный в смысле по всем странам), вероятно речь будет про исследования на его основе, по типу работ немецких демографов.
Также коллеги - (возможно?) авторы концепции (практической?) оценки науки в России, которую они с кем-то там тихонько обсуждают под сенью каких-то чиновников. Не очень понятно, о чем речь, но теоретически может коснуться каждого, тем интересней за ними следить.
Наконец, они, как и некоторые другие, явно имеют доступ к полноценному восу-скопусу, которого мы, простые смертные, лишены. Косяков даже выступал недавно про научную этику под эгидой какого-то ООО, которое ворует и перепродает этот самый доступ, оляля. Их еще и Писляков пиарит, во дела. Ну, новая этика. Грабь недружественное!
1 847
ага, пошли отписываться случайные персонажи.
в целом:
Выступал сегодня на семинаре в РАН, спрашивают: вот тут у нас все чаще голоса раздаются - вообще не публиковаться за рубежом, все такое. Как вот в этой ситуации того и сего и вообще, а то раздаются и раздаются, все громче и громче?
Что я могу ответить?
Друзья, историю делают люди.
Вы тоже люди. Не молчите.
1 847
когда-то давно я работал вместе с Асей. Очень ее уважаю за ее просветительскую работу и выражаю поддержку. Ася, ты крутая, в отличие от многих других представителей вида хомо сапиенс, процветающих в наших широтах
https://www.rbc.ru/politics/13/12/2023/6579c0199a7947d37be32546
1 847
Тот самый семантический поиск по научным публикациям. Приделал к нему простой API - вы ему текст, он вам найденные публикации в JSON. Код с комментами, должно быть понятно, есть readme на английском.
Поиск на стандартной модели all-MiniLM-L6-v2, которая обучена в том числе на корпусе Semantic Scholar. Именно ее использует, например, JSTOR, да и наверное многие другие. Вчера и в Litmaps заметил. Она маленькая, быстрая и достаточно хорошо работает, как по мне. Пробовал еще на SPECTER от Allen AI, там потяжелее всё, может тоже выложу.
API на flask, совсем простой.
Где брать сами метаданные, чтобы наполнить базу публикациями? Где можете, вестимо.
Моя корявая тестовая имплементация на ~1 миллион публикаций занимает 4 гига оперативки (зависит от набора метаданных), поиск быстрый.
Увы, пока так и не смог получить под этот проект сервер в Вышке и уже не уверен, что получу: с поддержкой AI-проектов у нас, стыдно признать, оказалось как-то не очень, если ты сам не из этой области (это мой случай), с серверами, наверное, дефицит. Так что если у кого-то есть какие-то идеи, можно обсудить. Только Nexus и прочую нелегальщину не предлагать :) Эти сами справятся, и, думаю, уже скоро.
У меня-то идей много: поиск рецензентов и экспертов, потенциальных соавторов, тематическое картирование, сети и кластеризация. Поиск множественных публикаций одного или немного измененного текста (накопал уже... даже в наших журналах нашел два почти совсем одинаковых :) ). Просто поиск по любой фразе\абзацу (попробуйте такое в GS\SS или восе-скопусе-ринце, хехе. а тут сработает).
https://github.com/IvanSterligov/Similarity/
1 847
не удержался и написал про одно маленькое опасение https://telegra.ph/Pochemu-do-sih-por-net-sistemy-ocenki-nauki-Rossii-12-06
1 847
Крупнейшие издательства и инфраструктуры данных и метаданных разродились новыми рекомендациями. Я рекомендую прочесть всем ученым, кто хоть как-то работает с данными и датасетами. Тем, кто управляет учеными, рекомендую в большей степени (пункт 12: «нет данных? нет надбавки!» Шутка, коллеги). Для редакций журналов чтение, на мой взгляд, обязательное.
1. When publishing their results, researchers deposit related research data and outputs in a trustworthy data repository that assigns persistent identifiers (DOIs where available). Researchers link to research data using persistent identifiers.
2. When using research data created by others, researchers provide attribution by citing the datasets in the reference section using persistent identifiers.
3. Data repositories enable sharing of research outputs in a FAIR way, including support for metadata quality and completeness.
4. Publishers set appropriate journal data policies, describing the way in which data is to be shared alongside the published article.
5. Publishers set instructions for authors to include Data Citations with persistent identifiers in the references section of articles.
6. Publishers include Data Citations and links to data in Data Availability Statements with persistent identifiers (DOIs where available) in the article metadata registered with Crossref.
7. In addition to Data Citations, Data Availability Statements (human- and machine-readable) are included in published articles where appropriate.
8. Repositories and publishers connect articles and datasets through persistent identifier connections in the metadata and reference lists.
9. Funders and research organizations provide researchers with guidance on open science practices, track compliance with open science policies where possible, and promote and incentivize researchers to openly share, cite and link research data.
10. Funders, policymaking institutions, publishers and research organizations collaborate towards aligning FAIR research data policies and guidelines.
11. All stakeholders collaborate in the development of tools, processes, and incentives throughout the research cycle to enable sharing of high-quality research data, making all steps in the process clear, easy and efficient for researchers by providing support and guidance.
12. Stakeholders responsible for research assessment take into account data sharing and data citation in their reward and recognition system structures.
https://www.crossref.org/blog/joint-statement-on-research-data/
1 847
Для коллег-науковедов:
14 декабря в 14:00 выступаю на семинаре по науковедению в ИИЕТ РАН, в основном с метриками из свежепредставленного датасета, а также метриками по отдельным журналам и авторам. Технических подробностей про скрипты и апи будет меньше, самой наукометрии - больше.
Что происходит с российской наукой? Новые данные о публикациях
В докладе представлены результаты библиометрических наблюдений за динамикой основных показателей России и ведущих отечественных НИИ и вузов за 2018-2023 гг. по БД Scopus. Анализируются изменения показателей по различным уровням журналов и тематикам, отдельным ведущим журналам, а также беспрецедентные перемены в разрезе издательств, публикующих российские работы. Отдельное внимание уделено перестройке международных связей и конфигураций соавторства, роли российских изданий в этих процессах. Приводятся первые данные на уровне отдельных ученых, характеризующие "утечку мозгов" и изменение сотрудничества с Россией.
1 847
Главный швейцарский грантовый фонд прекращает оплачивать OA-статьи в спецвыпусках журналов. Рекомендую ознакомиться с формулировками:
https://www.snf.ch/en/g2ICvujLDm9ZAU8d/news/the-snsf-is-no-longer-funding-open-access-articles-in-special-issues
Как вы понимаете, речь идет прежде всего о квази-швейцарском издательстве, главном ныне для российской науки. Его на безрыбье продвигают все подряд - и Хохлов, и анонимные академпопулистские каналы, и минобр со своим недобитым "белым списком", и РАН (на свои журналы там, кажется, наконец забили), и, конечно, РНФ.
Ирония в том, что все эти российские амбассадоры, инфлюэнсеры и инэйблеры фаст-фешна (Shein, тикток - есть ведь тут у китайцев-для-некитайцев что-то общее, некая экосистема дешевого перепроизводства) вовсе не про саму открытость и движение open access. Несколько раз обсуждал это с сотрудниками РНФ, им логика первой фразы в швейцарском релизе просто непонятна. Как это "required to make their results freely accessible to the public"? Какой публике? Нет, у нас в стране одним - отчитаться, другим - "обеспечить сквозную прослеживаемость" https://scientificrussia.ru/articles/edinaa-cifrovaa-platforma-gosteh-snizit-burokraticeskuu-nagruzku-na-ucenyh а публики тут и нет никакой.
Впрочем, это не новости, да и кого по большому счету волнует эта российская наука? А вот в мире мы наблюдаем серьезную коррекцию конфигураций OA-публикаций, и маленькая новация от SCNF - одна из множества ее частей. Больше того, речь идет о серьезном переосмыслении самой идеологии Open Access и о нарастании пессимизма от того, во что всё это вылилось. Тут и отсутствие координации, и геополитика в целом (cool war) и частности (вещи типа One Nation One Subscription), и новое "авторское" неравенство вместо читательского, и пассивность ученых-карьеристов. Намедни это в сжатом виде перечислил Ричард Поиндер, заявивший о провале самого проекта Open Access, чем вызвал восторги корпоративных идеологов типа Джеймса Батчера.
Проблем хватает, трудно спорить. Но мне кажется, не все так плохо и никакого провала нет. Ну да, общий новостной фон везде таков, что порой адекватным кажется лишь сползание в дыру realpolitik и душевной лени, и это явно повлияло в т.ч. на Поиндера, одного из уважаемых обозревателей. У нас фон погуще, чего стоит только "запрет ЛГБТ" (молчим... а потом будем с гордым видом ругать европейских редакторов-рецензентов, отказывающихся брать работы из России...). Но этак можно совсем загрустить, поэтому я собрался посвятить очередной выпуск своей рассылки обзору достижений OA и прогнозам, в том числе для России, куда ж без нее. Конечно, с фокусом на практику, как обычно. Если что, подписывайтесь (ivan.sterligov@gmail.com), по-прежнему доступно всем в науке из некоммерческого сектора.
1 847
Препринты стали ценным источником данных о развитии науки.
Ключевое достоинство - гораздо меньше влияние административной наукометрии с ее отчетами по квартилям, симуляциями науки и прочими списками вак. В результате нерецензируемые препринты оказываются в каком-то смысле показательнее и честнее, чем "рецензируемые" метрики по журнальным наукометрическим базам.
Естественно, подсчет препринтов оправдан только для наук, где есть соответствующие традиции и инфраструктура. Лучше всего дело обстоит с arxiv.org. Этот главный сервер препринтов до сих пор чаще ассоциируется с физикой и Перельманом, но на деле там давно рулит CS. Это в мире в целом, а в России, уверен, физика и математика еще доминируют.
На первой картинке распределение всех препринтов мира по областям, на второй - рейтинг российских организаций по среднегодовому числу препринтов 2020-2022. Вышка смотрится неплохо: 4 место в России и 254 в мире, хотя физиков у нас по сравнению с остальными лидерами поменьше (зато CS и математика на высоте). Жаль, нельзя фильтровать по областям - продвинутая аналитика доступна только members https://info.arxiv.org/about/membership.html
Вся эта красота, кстати, возможна за счет сотрудничества arxiv и scopus, т.е. традиционные базы относятся к этому формату очень внимательно. Источник: https://info.arxiv.org/about/reports/2022_usage.html
1 847
семантический поиск наконец пошел на взлет 🧞♂️
ась? что это такое? это нейросетевой поиск по "смыслу" текстов, отличающийся от лексического: например, понимает, что "пацифизм" и "миролюбие" - вещи близкие. Натренирован на миллионах текстов. Вводим нечто в свободной форме - получаем наиболее семантически похожие тексты из базы. Специалисты понимают, какие тут перспективы (огромные!).
- Появился в JSTOR
- Появился в Litmaps
- Скоро появится везде
...
- Появился прямо тут: я сделал неплохой поиск по ~миллиону публикаций РФ на стандартной модельке, обученной в т.ч на Semantic Scholar. Cейчас разворачиваем его в Вышке для подбора рецензентов и всяких прочих дел) затем, надеюсь, масштабируем на все публикации мира
Крайне рекомендую введение в вопрос от главного библиотекаря современности Аарона Тая из Сингапура:
http://musingsaboutlibrarianship.blogspot.com/2023/11/jstor-generative-ai-pilot-or-is.html
1 847
давным-давно, в 2017 году, когда Цукерберг купил AI-стартап Meta, который предсказывал цитируемость, я и остальные начали писать, что роботы-ученые не за горами, вполне есть шанс дожить.
fast-forward to 2023:
Researchers have also flagged work by an "AI scientist" team, the existence of which multiple sources confirmed. The group, formed by combining earlier "Code Gen" and "Math Gen" teams, was exploring how to optimize existing AI models to improve their reasoning and eventually perform scientific work, one of the people said.
не очень понятно, как это связано с их новым супер-пупер проектом Q*, но в нашем контексте это забавно: обычные ученые выше Q1 не прыгнут. А также: A* породили Q*.
https://www.reuters.com/technology/sam-altmans-ouster-openai-was-precipitated-by-letter-board-about-ai-breakthrough-2023-11-22/
1 847
Недавно я писал про состояние российской CS\AI науки, а тут как раз подоспела соответствующая официальная конференция под названием AI Journey Вроде бы не наука, а пиар, но устроители сами приглашают сравнивать себя со всякими NeurIPS, заявляя на сайте:
№1 among global AI conferences by number of participants*
*Based on the number of registrations according to publicly available data, compared to other dedicated AI conferences
Рядышком написано no registration required, да и кнопки регистрации не видно.
Экая наукометрия. Особенно учитывая, что это никакая не научная конференция, а потемкинская деревня, лишенная ключевых конференционных атрибутов: программного комитета, процедуры отбора, публикации трудов etc.
Меня поправят: это не научное, а гораздо более широкое событие. Тут и чиновники, и госбизнес, и группа "Филатов и карась" с новой песней, они там минглинг, тинглинг, интерэктинг, нетворкинг. Да я и сам понимаю, тем более, судя по программе, ученых в этом году хватило только на один день из трех. Поэтому театр-варьете. Разве что главный зритель в этом году не придет, уже видел это шоу в прошлом году. Там ведущий AI-ученый из, эээ, одного университета рассказывал ему, что надо вкладываться в ML, иначе наши дроны будут плохо, эээ, выполнять свои задачи. Интересно, но не «Дни Турбиных».
Лучше посмотрим, кого из иностранцев смогли заманить на это мероприятие.
Номер один – Swagatam Das из Индии – явно ок.
Пара китайцев из Tsinghua – вероятно ок, но гуглятся плоховато.
Остается два человека.
С докладом «Prolegomena on the mineralogical challenge of the the AI : the blind spot of an anthropological transition» выступит некий Yanniсk Harrel, немного загадочный деятель. Надеюсь, его хорошо покормят.
И вот такой гость из Universitas Teknokrat Indonesia. Он идеален. Идеален для сравнения с вышеупомянутым Swagatam Das, я буду использовать сей пример от Сбера в своих лекциях и семинарах. Посмотрите на метрики в GS, потом на метрики в Скопусе. А потом снова в GS, чтобы понять, как это у человека 30 цитирований по одной базе и 6500 по другой :)
1 847
Уфф, худо-бедно представил проект, вроде бы небесполезно)
Сам датасет тут https://doi.org/10.5281/zenodo.10119095
В формате all included: и сами данные, и скрипты для их получения и обновления, и все использованные списки журналов и поисковые запросы. Всё можно настраивать под свои нужды.
Метрик много: общее число публикаций России, в разных журналах и экспертных списках по направлениям наук, по 20 крупнейшим издательствам, по российским журналам, с такими-сякими странами в разных форматах. и то же самое для 20+ российских организаций (ведущие вузы и РАН), всё в динамике с 2018 г.
Видеозапись с визуализациями всего этого богатства будет в канале у коллег из НЦ.
По селективным журналам у РФ в 2023 г. ожидается падение 30-40% по сравнению с "нормальным" 2021 г., это эффект не только от утечки селективных мозгов, сворачивания международных коллабораций (полагаю, основной фактор), аффилиационной политики ЦЕРН, траблов с оборудованием и реагентами и т.д., но и от массового перехода на MDPI. Это издательство в ближайшее время, вероятно, потеснит Плеядес и станет главным для России.
1 847
Repost from Выше квартилей
Семинар НЦ НИУ ВШЭ: Открытый воспроизводимый датасет публикационных метрик России
Рады пригласить всех на очередной семинар Наукометрического центра, который пройдет онлайн во вторник 14 ноября в 16:00.
На семинаре советник проректора НИУ ВШЭ Иван Стерлигов представит свой новый научный проект:
«Открытый воспроизводимый датасет публикационных метрик России».
Выступление будет состоять из двух частей. В первой будут продемонстрированы инструменты автоматического сбора датасета, позволяющие всем желающим легально получать и актуализировать множество метрик по России и другим странам, а также любым другим сущностям в БД Scopus.
Вторая часть будет посвящена самим показателям, в первую очередь их динамике в 2022-23 гг. Рассматриваются изменения в числе публикаций России в разрезах тематик и уровней селективности изданий в сравнении с рядом других стран, смена направлений и форматов международного соавторства, перемены в обслуживающих отечественную науку издательствах, динамика по совокупности российских изданий и отдельным ключевым международным журналам. В заключение приводятся аналогичные показатели по набору 20+ ведущих российских вузов и НИИ.
Семинар адресован в первую очередь науковедам и наукометристам, а также всем, интересующимся измерениями науки и происходящим с публикациями России и мира.
Требуется предварительная регистрация.
#анонс #вебинары
1 847
По работе пришлось снова взглянуть на состояние царицы наук (AI\ML\датамайнинг сегмент Computer Science) в России.
Посмотрел доклады на профильных топовых конференциях (AAAI,CVPR,ECCV,ICCV,ICDM,ICLR,IJCAI,KDD,NeurIPS,WSDM) с 2019 г., данные по 22-23 гг. заведомо неполные, но настораживают: в 2023 доля РФ от мира пока составляет 0,17% вместо привычных все прошлые годы 0,5%
Сохраняется крайняя концентрация, фактически всё сообщество крутится вокруг трех типов организаций
- Вышка-Сколтех-Физтех с небольшим довеском ИТМО, МГУ и Иннополиса
- Госкомпании в лице Яндекса и Сбера
- R&D-центры коммерческих иностранцев: Samsung (привет Антону Конушину) и Huawei
50% докладов имеют аффилиации 2 и более упомянутых организаций одновременно, иногда и по 4 организации сразу.
На публикации без этих организаций приходится процентов 7 - немного РАН и региональных вузов, полтора стартапа.
На графике показана примерная динамика по этому нашему сообществу ласковых теляток, так как данные неполные, можно уверенно отметить только рост Сбера, но в целом там везде одни и те же люди.
Стандартный вопрос сейчас - где это там? Тут или нет?
Оба лидера российского CS - Виктор Лемпицкий и Дмитрий Ветров - насколько понимаю, уже нет. На них в сумме приходится больше половины всех цитирований России в данной области. Многие остальные - тоже. Например, лидер проекта https://deeppavlov.ai/ , ключевого для РФ в области всяких чатботов и NLP - Михаил Бурцев - уже не завлаб МФТИ, а Ландау-стипендиат в Лондоне https://lims.ac.uk/profile/?id=114 Он, кстати, был еще и научным директором сбербанковского AIRI. Ну, заменили на аналог из Сколтеха, пока есть кем заменить. Натурально, оставшиеся - на вес золота. Так, заметная часть изученных докладов и Вышки, и МФТИ, и львиная доля для РАН в 2022 г. в списке авторов имеет одного и того же человека - Александра Гасникова (показательны комменты про него от юных физтехов https://wiki.mipt.tech/index.php/%D0%93%D0%B0%D1%81%D0%BD%D0%B8%D0%BA%D0%BE%D0%B2_%D0%90%D0%BB%D0%B5%D0%BA%D1%81%D0%B0%D0%BD%D0%B4%D1%80_%D0%92%D0%BB%D0%B0%D0%B4%D0%B8%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B8%D1%87). Самый ценный ученый страны? Возможно.
Все вышеупомянутые уже успели обучить кучу молодежи, только где теперь эта молодежь? У одного Ветрова, говорят, в одном только DeepMind\Google чуть не 10 воспитанников трудятся. А тут чего помимо огромной зарплаты? Крепить скрепы кресла какого-нибудь Ковальчука-младшего или поверхностно более милых начальников яндекса-сбера? Обучать политически правильные модели на стенограммах Госдумы, пользуясь провезенными в тюремном кармашке видеокартами прошлого поколения? И параллельно вымарывать из описаний своих международных проектов всё, что хоть как-то напоминает об их связи с Россией (зацените сайт того же deeppavlov)?
Конечно уже нашлось и найдется много желающих. Но, боюсь, маловато для полноценного развития отрасли в ближайшие годы. Царицы наук, да.
1 847
https://github.com/IvanSterligov/S-pets formerly known as Scopets :)
Я выложил свои рабочие скрипты для различных подсчетов метрик Scopus без подписки, это часть предстоящего релиза датасета основных наукометрических показателей России, который автоматически обновляется на их основе.
Скрипты умеют считать число публикаций, цитирований, индекс Хирша, выгружать списки публикаций и обогащать их метаданными из Semantic Scholar, CrossRef и OpenAlex, а также фильтровать результаты с помощью настраиваемых списков журналов.
Они уже успешно используются в ряде российских организаций, кто-то, кажется, даже зарабатывает с их помощью, но это не рекомендуется, так как нарушает условия использования бесплатного Scopus API. Использование скриптов для исследовательских целей легально.
1 847
Недавно я упоминал работу с интересной критикой подхода Иоаннидиса к построению рейтинга ученых мира, там хардкор, не буду повторять.
А теперь ак. Хохлов продвигает этот рейтинг в своей телеге, не только не ссылаясь на него по-нормальному, но и вообще не упоминая самого Иоаннидиса :) https://t.me/khokhlovAR/534 Человек, насколько куртуазный в смелых и правильных выражениях для широкой публики, допускает форменное академическое безобразие) Впрочем, дело хозяйское, я о другом, тем более внимание к рейтингу он привлек успешно.
Помимо вышеупомянутой критики композитного индикатора, рейтинг Иоаннидиса и ко https://elsevier.digitalcommonsdata.com/datasets/btchxktzyw/6 страдает от отсутствия тематической нормализации (попытка авторов объяснить, почему https://doi.org/10.1371/journal.pbio.1002542) и представители разных областей находятся в неравном положении (в последнем выпуске эту пилюлю подсластили, но в целом перекос остался). Полноценного долевого подсчета там тоже нет, хотя есть определенные схожие метрики. Поэтому какие-то обобщения на его основе делать сложно, но я таки предлагаю посмотреть на основные страны, там прослеживается кое-что интересное.
А именно, Россия лидирует. Мы чемпионы по самоцитированиям и по среднему возрасту.
На первой картинке число ученых в рейтинге vs медиана процента самоцитирований.
На второй - средний наукометрический возраст (год выхода первой публикации) vs те же самоцитирования, размер шарика = число ученых.
Кто-то скажет, что наши ученые самые, кхм, умудренные, поэтому и цитируют себя больше. Был, например, такой академик Маслов, просто король в обоих отношениях. Конечно, в этом есть некоторая логика: нужно иметь что процитировать из своего, у старших с этим попроще.
Но как же юный Египет? Там дрючат метриками по скопусу, а еще любят мусор. Италия? Аналогично, только с мусорными журналами построже, кейс известный https://doi.org/10.1016/j.joi.2021.101204
На деле вклад в сдвиг по самоцитированиям для России отчасти связан с перекосом в сторону физики и коллайдеров, где эти метрики выше. Но не только. В таблице я сравниваю эти метрики для России, США (тоже старички) и Китая, зацените, например, биологию.
