Для тех кто хочет самостоятельно изучить содержание федерального портала открытых данных data.gov.ru, его слепок выложен в промежуточное хранилище Национального цифрового архива (ruarxive.org).
Размер слепка 15GB, внутри метаданные полученные экспортом в CSV формате и для каждого пакета данных отдельная директория внутри которых файл files.jsonl с метаданными каждого выгруженного файла этого набора данных название файла, расширение, формат и размер. А в папке files внутри пакета сами сохранённые файлы этого набора данных.
Ограничения:
- в метаданных нередко форматы указаны неверно и в итоге файл может иметь расширение XML, а внутри это ZIP. Не удивляйтесь, просто будьте к этому готовы, это особенность первоисточника
- часть источников данных уже недоступны и не все файлы скачались. Пока не проверяли сколько да, сколько нет, но скорее не так много.
- часть источников данных сменили сайты и ссылки и вместо файлов с данными там HTML страницы. Это надо проверять по каждому файлу, пока такой проверки не проводили. Это скорее редкость, но вот у ФТС (таможни) все наборы данных в таком состоянии.
Файл пока в промежуточном хранилище с ограниченным трафиком, поэтому если хотите с этими данными поработать прямо сейчас, напишите, мне лично @ibegtin или в чат @begtinchat я дам прямую ссылку. Окончательный дамп с описанием и ссылкой на облачное хранилище будет на нашем общественном портале открытых данных hubofdata.ru, он сейчас используется для ведения метаданных и ссылок цифрового архива сайтов.
Я также напоминаю что если Вы знаете какие-либо большие общественно значимые веб сайты находящиеся под угрозой исчезновения целиком или частично, пишите мне на [email protected], мы поставим его на обязательную архивацию.
#opendata #datasets