Продолжая тему институциональных структур в области данных [1] и того как строится инфраструктура и работают инфраструктурные организации важным моментом является то как именно эти организации работают. Если посмотреть на классификацию data institution от The ODI то выходит что они делятся, по сути, на три направления, иногда пересекающихся. Далее моя интерпретация этой классификации: - policy-making - вырабатывающие госполитику и рекомендации - standards and tools - создающие общие стандарты и инструменты - data infrastructure - общая инфраструктура, каталоги данных, облака и тд.
Обычно проекты/организации не совмещают эти роли, слишком разные знания и опыт для этого нужны, но специализируются на чём-то одном и вступают в союзы и разного рода партнерства.
Здесь особняком стоят инфраструктурные организации в области данных. Их полезность, эффективность, востребованность и устойчивость определяют числом вовлеченных поставщиков данных и участников обмена данными.
Например, успешность проект Humanitarian Data Exchange [2] можно измерить в том что 289 крупных международных и национальных организаций публикуют там данные о природных катастрофах, инфраструктуре и ликвидации последствий катастроф. Что их мотивирует? Целенаправленная политика UN OCHA по предоставлению данных из собственных подразделений, предоставление данных теми кто получает от них финансирование и корпоративная ответственность для крупных транснациональных холдингов вроде Facebook. Иначе говоря внутри три стопа: - внутренняя мотивация и перестройка процессов - вовлечение финансируемых организаций - привлечение и мотивация партнеров
Есть и другие примеры. Например, UK Data Service [3], это инфраструктура научных данных Великобритании является продолжением обязательных научных архивов и для исследовательских центров финансируемых за счёт государства они являются обязательным центром "сдачи данных'.
Ещё один проект, Zenodo [4] - это европейская инициатива от CERN в основе которой европейская политика открытого доступа (open access) и создание инфраструктуры для публикации данных исследователями. Опять же с учётом того что выдача грантов ЕС научным учреждениям требует и учитывает последующее раскрытие ими данных.
А вот инфраструктурные коммерческие проекты делают сильный акцент на удобстве. Проекты вроде data.world или QRI фокусируются на удобстве обмена данными и на возможности их анализировать прямо в портале/каталоге/сервисе данных. И на бесплатности до определенного объёма. Хотя и можно обратить внимание что data.world всё более склоняется в платформу для дата-журналистики и не-научной аналитики, а QRI в инфраструктурный сервис для дата-инженерии, а также ещё есть несколько десятков похожих сервисов.
Особняком стоят проекты вроде Figshare [5] и Mendeley Data [6]. Это коммерческие проекты для публикации данных академическими институтами, но у них freemium модель, с сильным фокусом на потребности исследователей, в поиске данных для цитирования и в доступности их данных для цитируемых другими исследователями.