Ivan Begtin
7.99K subscribers
1.77K photos
3 videos
101 files
4.49K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and other gov related and tech stuff.

Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Secure contacts [email protected]
Download Telegram
Свежий доклад ОЭСР по применению ИИ в науке [1], вернее это даже не доклад, а сборник статей объединённых одной темой. Много примеров того как ИИ уже сейчас применяется в научной работе и о том как может применяться в ближайшем будущем. В целом документ ИИ-оптимистичен, практически все тексты о том как ИИ хорош и полезен во всём: автоматизации лабораторий, поиске лекарств, удобных инструментах управления знаниями и так далее.

Важная часть текстов посвящена вопросу Is science getting harder? (Становится ли тяжелее заниматься наукой?) и ответ на этот вопрос - да, а ИИ рассматривается как важный усилитель работы учёных.

Почитать полезно, поскольку это та область которая как раз должна вызывать наименьшие опасения этики работы с ИИ. Возможно.

Ссылки:
[1] https://www.oecd.org/publications/artificial-intelligence-in-science-a8d820bd-en.htm

#openscience #ai #readings
Из любопытного, в Meilisearch, одном из самых быстрых опенсорсных движков для поиска структурированного контента, добавили векторный поиск [1], а их CTO интересно и с примерами рассказывает про применение Meilisearch для семантического поиска и построения чат-ботов [2]. Там есть технические подробности для интересующихся, лично я планирую посмотреть пристально на эту новую возможность.

А из другого бросившегося в глаза в их анонсе, это ссылка на бот дающего ответы на основе их же документации [3], чат боты для технической документации это хорошая идея, да и для любой другой документации больших текстов тоже.

Ссылки:
[1] https://blog.meilisearch.com/vector-search-announcement/
[2] https://github.com/meilisearch/meilisearch/issues/3838
[3] https://blazy-chat.vercel.app/

#opensource #search
Forwarded from Ах, этот Минфин (Olya Parkhimovich)
В продолжение новости о возобновлении публикации отчетности банков: Стал доступен перечень сведений, которые компании-эмитенты вправе не раскрывать.

К таким сведениям относится информация:

– о лицах, входящих в состав органов управления и органов контроля за финансово-хозяйственной детяельность;

- о сделках эмитента, его контролирующих лиц, подконтрольных ему лиц;

- о банковских группах, банковских холдингах и ассоциациях;

- о лицах, являющихся или являвшихся акционерами эмитента и подконтрольной эмитенту организации;

- о дочерних организациях эмитента;

- о финансовых вложениях эмитента;

- об операциях и объеме средств в иностранной валюте;

- об остатках и обеме средств на счетах;

- о контрагентах;

- о реаорганизации эмитента и подконтрольных эмитенту организаций;

- и др.

Полный перечень можно найти в Постановлении Правительства РФ от 4 июля 2023 года (https://static.government.ru/media/files/LI99DyXKF4GmQRe0YAsF1wH5cgNEoKnN.pdf)
Eusko Jaurlaritzaren datu irekiak

В рубрике как это устроено у них портал открытых данных Страны басков (провинция Испании) [1]. Можно сказать что является типичным европейским регионалом порталом открытых данных с акцентом на статистике и на геоданных, кроме двух интересных особенностей.

Во первых на нём размещено около 10 тысяч наборов данных, при том что население провинции составляет всего около 2 миллионов человек. Это довольно много, даже если предположить что они тоже дробят статистические показатели.

И, во вторых, портал построен на тематической классификации по 16 Objetivos de Desarrollo Sostenible (Целям устойчивого развития, ЦУР), что для порталов открытых данных довольно необычно, обычно темы используют другие, в Европе это или геотемы из ISO 19115 или Data Themes применяемые в Европейском портале открытых данных.

Плюс у портала есть множество API, поддержка SPARQL и тд.

Ссылки:
[1] https://opendata.euskadi.eus/hasiera/

#opendata #spain #basque #euskadi #datasets
Тем временем в Великобритании вновь возвращаются принятию Online Safety Bill, проекта закона пережившего уже 3-х премьер министров и обязывающего платформы встраивать бэк-доры для служб Правительства UK для возможности поиска в мессенжерах на устройствах пользователей противоправного контента. Об этом многие специалисты в инфобезе бьют тревогу [1] и даже есть открытое письмо на эту тему [2]. Собственно представителей правозащитных организаций об этом и говорят что такое демонстративное пренебрежение правами людей со стороны либеральной демократии это очень плохой сигнал для всех стран [3].

Посмотрим чем закончится принятие это законопроекта. Я ставлю на то что если его примут, то компании предоставляющие услуги P2P коммуникаций скорее уйдут с рынка UK.

Ссылки:
[1] https://techcrunch.com/2023/07/05/uk-online-safety-bill-risks-e2ee/
[2] https://haddadi.github.io/UKOSBOpenletter.pdf
[3] https://twitter.com/OpenRightsGroup/status/1676860821857509376

#privacy #security #uk
Свежий инструмент Hashnode Rix [1] по модели компаньёна разработчика. Умеет отвечать на вопросы относительно написания кода, На сложные вопросы ответить не может, а на вот такие простые легко.

Уже просто таки даже интересно, когда от supportive AI придёт мода на proactive AI. Пишешь код, к примеру, а тут тебе AI помощник и пишет "Йоу, чувак, да у тебя веб приложение. А кинь мне список страниц что тебе нужны, я сейчас сгенерю" и тд.

Ссылки:
[1] https://hashnode.com/rix

#ai #tools
В рубрике как это работает у них, портал визуализации статистики внешней торговли Эстонии data.stat.ee [1]. Создан командой Datawheel, стартапа которые когда-то создавали DataUSA и ещё ряд проектов с наглядной визуализацией разного рода официальной и частной статистики.

В случае Эстонии это госпортал с официальной статистикой внешней торговли, с наглядной визуализацией и с интерактивной частью где можно посмотреть.

Лично я предпочитаю порталы где можно удобно работать с данными, скачивать или делать запросы к СУБД, но вот такие визуализации хороши когда нужна наглядная визуализация для презентации.

Ссылки:
[1] https://data.stat.ee

#opendata #dataviz #estonia
В рубрике интересных наборов данных сайт-сообщество iNaturalist [1] изначально созданный как неофициальное сообщество наблюдение за животными и растениями и идентификацией их экспертами/участниками сообщества, далее взятый под опеку Калифорнийской академией наук и развиваемый в тесной интеграцией с другими большими проектами по систематизаций флоры и фауны, такими как GBIF.

В iNaturalists участники публикуют фотографии/наблюдения животных в естественной среде, всего размещено более 147 миллионов наблюдений от 2.7 миллионов наблюдателей, а также зарегистрировано 432 тысячи видов животных и 316 тысяч экспертов.

У проекта есть открытое API [2], а также слепок данных по 66 миллионам наблюдений опубликованный на GBIF [3] (на GBIF попадает не всё, а только наблюдения подтвержденные экспертами).

Это большой некоммерческий научный проект который можно отнести к гражданской науке и который охватывает практически весь мир. В нём можно найти экспертов и наблюдателей и результаты наблюдения из практически всех, даже очень малых или очень бедных стран

Ссылки:
[1] https://www.inaturalist.org
[2] https://api.inaturalist.org/v1/docs/
[3] https://www.gbif.org/dataset/50c9509d-22c7-4a22-a47d-8c48425ef4a7

#opendata #datasets #biology
Forwarded from Open Data Armenia (Valeria Babayan)
You are probably going to be surprised, but Armenia holds one of the leading positions in the region of Eastern Europe and Central Asia, backing down only to Ukraine and slightly surpassing Kazakhstan and Russia, according to the Global Data Barometer 2022.

The Armenia’s assessment comprised by Georgia-based experts shows that the country’s relative strength affecting the relatively high index (44.6/100) is its public finance data. On the other hand, the weakest of Armenia’s capabilities is its situation with the open data. We will spare no effort to boost this dimension of Armenia’s culture of dealing with the data, which will result in deeper societal changes, increasing consciousness and self-reflexion, as well as in policy responsiveness and effectiveness.
К вопросу о поиске данных, в портал открытых данных по Армении (data.opendata.am) [1] мы начали загружать больше данных из разных источников и автоматически. Я вспомнил навыки по загрузке данных в CKAN и просто загрузил датасеты которые собирал в рамках Common Data Index с фильтром по Армении как по стране. Сейчас там более 700 наборов данных и ещё не меньше можно собрать.

По такому же принципу существует портал openAfrica [2], тоже общественная инициатива, только они собрали 6 886 по всему континенту. Не очень много, можно и больше, я недавно с ними общался и подсказывал где больше африканских порталов с данными. Собственно порталы на базе CKAN обладают встроенными API и функциями сбора данных из других порталов. По опыту API удобнее, правда.

И вот тут есть особенность что чем больше страна, тем больше по ней данных разбросано по международным и научным каталогам данных, потому что есть данные исследователей из страны, есть данные по биоразнообразию, есть данные исследований о земле, данные спутниковых снимков и так далее. Если поискать, например, данные о России за пределами России то можно насобирать до 40-50 тысяч наборов данных без феноменальных сложностей.

На одном только портале Pangaea более 14 тысяч наборов данных [4] по ключевому слову "Russia". К примеру, по слову "Armenia" находится только 46 наборов данных [5]. Поэтому размер территории, экономики и научной активности имеет значение когда собираешь данные по отдельной стране, за её пределами.

Я когда-то думал об этом размышляя над перезапуском нашего российского Хаба открытых данных [3]. Я совершенно не шучу что туда можно очень быстро добавить очень много данных, очень-очень много данных, разного размера, от маленького объёма до баз данных которые невозможно обработать на персональном компьютере.

Но в целом Государство российское, в его нынешней инкарнации, много лет скорее препятствует работе по повышению доступности данных. Помимо того что они убили Кенни портал открытых данных data.gov.ru, так за все эти годы не появилось ни одного портала научных данных, кроме ЕСИМО, нет нормальных каталогов геоданных, и сами открытые данные госорганов сейчас крайне фрагментированы даже когда доступны.

Поэтому можно ли и нужно ли создавать Российский национальный не-государственный портал открытых данных - это вопрос открытый. И в значительной степени он упирается в аудиторию такого проекта.

Ссылки:
[1] https://data.opendata.am
[2] https://africaopendata.net
[3] https://hubofdata.ru
[4] https://pangaea.de/?q=Russia
[5] https://pangaea.de/?q=Armenia

#opendata #datasets #russia #armenia #datacatalogs #data
Но есть и хорошие новости, крипто-пузырь сдувается в ноль [1] и, лично я считаю, что это только к лучшему. Удивительно даже как долго этот хайп длился и что у него до сих пор так много фанатов.

Ссылки:
[1] https://www.brookings.edu/articles/crypto-crashes-and-job-slashes-lessons-for-local-leaders-on-building-an-innovation-ecosystem/

#crypto #tech #readings
В рубрике интересных наборов данных, набор данных по использованию земли в Европейском союзе начиная с 2000 года по 2019 [1], а также визуальное представление этих данных в проекте The Open-Earth-Monitor Cyberinfrastructure [2]

Этот проект, как и многие другие геоданные с высокой детализацией, создаются в рамках исследовательской программы ЕС консорциумом университетов, исследовательских групп и частных компаний. Кроме него стоит посмотреть на другие значимые наборы геоданных публикуемые OpenGeoHub [3].

В очень хорошем смысле можно позавидовать их команде, создающей огромные наборы данных в хорошем качестве и за государственный счёт (научных программ ЕС и глобальных институтов).


Ссылки:
[1] https://opengeohub.org/datasets/high-resolution-annual-continental-european-land-use-land-cover-data-since-2000/
[2] https://ecodatacube.eu
[3] https://opengeohub.org

#opendata #datasets #geodata #europe
Вышел свежий доклад ЮНЕСКО Open data for AI: what now? [1] посвящённый, как вы догадались, открытым данным для ИИ. Доклад короткий, на 64 страницы, но весьма интересный по содержанию, как с обзором текущих инициатив по открытости данных, так и развития их использования для создания ИИ инструментов и с учётом имеющихся рисков и ограничений.

Перечень действий и рекомендаций там довольно универсальный для публикации открытых данных, к ним лишь добавился акцент на данных высокого качества и по публикации данных AI-Ready (готовых для ИИ).

В целом, мне нравится этот документ, он чётко про открытость данных, с набором конкретных рекомендаций которые, я не сомневаюсь, будут применяться многими развивающимися странами. Для правительств стран раздумывающих о перезапуске повестки открытых данных - это важный ориентир для публикации данных в привязке к ИИ.

Ссылки:
[1] https://unesdoc.unesco.org/ark:/48223/pf0000385841

#opendata #unesco #documents #readings
Ещё один интересный документ-доклад OECD Government at a Glance 2023 [1]. Как очевидно из названия документ от ОЭСР и посвящён эффективности и деятельности входящих в ОЭСР стран и ряда стран кандидатов. В докладе много цифр и фактов про государственное управление разделённых по главам доверия к демократии, цифровое правительство, открытые госданные, бюджетирование, система госзакупок и так далее. Для тех кто интересуется как развиваются все эти темы в развитых странах это будет полезное чтение. Для облегчения его я могу порекомендовать сразу скачать доклад в PDF [2], поскольку онлайн версия там не самая удобная. А также посмотреть конкретные цифры на портале статистики ОЭСР [3], правда портал ОЭСР прямые ссылки на статразделы не поддерживает, поэтому там надо искать нужные данные в разделе Public Sector, Taxation and Market Regulation.

Этот доклад ОЭСР публикуют раз в 2 года и последний был в 2021 году. Тогда ещё были данные по России, которые собирались несмотря на заморозку в 2014 году вступления России в ОЭСР. В 2023 году данных по России уже нет совсем, все упоминания России только в контексте военного конфликта, роста инфляции, роста цен на продовольствие и так далее.

Ссылки:
[1] https://www.oecd-ilibrary.org/governance/government-at-a-glance-2023_3d5c5d31-en
[2] https://www.oecd-ilibrary.org/deliver/3d5c5d31-en.pdf?itemId=%2Fcontent%2Fpublication%2F3d5c5d31-en&mimeType=pdf
[3] https://stats.oecd.org/

#opendata #oecd #digitalgovernment #government #readings
Когда-то одним из наиболее удобных инструментов для ведения заметок был Evernote, продукт одноимённого стартапа которые почти идеально для 2004 года, года его запуска, синхронизировался с устройствами и долгие годы был любим многими пользователями. Я лично пользовался им около 7 лет, скажу тогда это был очень удобный инструмент. Потом пришло много инструментов ему на замену, от личных wiki, до продуктов вроде Notion, Obsidian, Roam и ещё многих других.

В декабре 2022 года Evernote купила европейская компания Binding Spoons, в феврале 2023 года они уволили там 129 сотрудников, а 10 июля анонсировали полное увольнение офиса в США [1] и что разработка вестись будет теперь только в Европе. Правда непонятно кем учитывая что разработчики были в США, но, тем не менее, происходящее уже свершившийся факт.

Что использовать ему на замену?

Лично я исхожу из следующего подхода:
- результаты изучения, чтения чего-то и размышлений, которые могут быть публичными, для этого использую этот телеграм канал
- личные заметки в Joplin, Notion или Obsidian. Я лично предпочитаю Notion, но не претендую что это лучший вариант для всех
- рабочие заметки в Markdown и в Git когда это возможно

Ссылки:
[1] https://arstechnica.com/gadgets/2023/07/evernote-the-memory-app-people-forgot-about-lays-off-entire-us-staff/

#evernote #startups #notetaking
Я, кстати, не могу не отметить что в реестре порталов с данными Common Data Index уже больше порталов данных стран постсоветского пространства чем в datacatalogs.ru. Например, в реестре 37 порталов с данными в Республике Казахстан [1] из которых, правда, 33 являются геопорталами, по большей части на базе ArcGIS. Данные оттуда вполне можно получить, главные ограничения юридические поскольку в ArcGIS не вносят информацию о лицензиях/правах на данные. Впрочем я уже неоднократно писал [2] что с открытыми данными в Казахстане проблема другого рода, по факту data.egov.kz порталом открытых данных не является и его создатели всячески препятствуют использованию этих данных. Зачем они так делают я недоумеваю, странно что негосударственный портал открытых данных Казахстана ещё никто не создал.

Ссылки:
[1] https://registry.commondata.io/country/KZ
[2] https://t.iss.one/begtin/4626

#opendata #data #kazakhstan