Обложка канала

Ivan Begtin. Страница 58

3903 @begtin

I am focused on Open Data, Procurement, e-Government, Open Government and other tech stuff

  • Ivan Begtin

    Я ранее писал о headless BI [1] и headless CMS [2], так называемых безголовых (headless) продуктов, не имеющих интерфейсов для конечных пользователей. В случае CMS это достаточно давнее изменение в подходе, его смысл в том что разделить интерфейсы редактирования текста и интерфейсы его представления. А важно это потому что каналы дистрибуции контента могут быть множественными: веб сайт, приложение для телефона, сайт для планшета, канал в Telegram, канал в Slack и ещё много чего. Поэтому headless CMS довольно неплохо развиваются, своя ниша у них уже давно есть. С headless BI все чуть сложнее, но несколько стартапов в этой области уже существуют. Отделить создание аналитической базы и базы метрик от пользовательского интерфейса также важно в некоторых случаях поскольку систем интерфейсов может быть много и разных, а метрики нужны одни и те же. Другой пример headless продуктов это Netlify, Fly.io, Appfleet и ещё с десяток других FaaS провайдеров (Functions-as-a-Service), где от веб интерфейса остаётся только биллинг, а вообще вся работа идёт через командную строку или API. Для работы с этими платформами можно использовать любой инструмент, свой, из экосистемы, сделать на заказ и тд. Эти продукты тоже можно отнести к headless. Практически все headless продукты экосистемные, с заходом на то что они быстро и легко в существующую экосистему встраиваются и также позволяют поверх них и в связке создавать свои продукты. Интересный вопрос в том какие headless продукты будут следующими? Headless CRM, ERP, CDP? Такого пока нет. Headless mobile apps пока подпадает под headless CMS. Продукты в области data engineering и data science почти все безголовые от рождения, кроме старых ETL систем разве что. Если есть идеи куда может развиваться эта концепция и какие продукты можно создавать то поделитесь своими мыслями в чате @begtinchat. Ссылки: [1] https://begtin.substack.com/p/19 [2] https://t.me/begtin/1902 #headless #data #products #startups
    #19. Headless and reverse data

    Историк - это перевернутый пророк (c) Фридрих Шлегель

    Substack
  • Ivan Begtin

    Коллекция полезных размышлений о том как считать ROI у команд работающих с данными [1] [2] [3] и о разнице в работе между data engineer, data scientist, analytics engineer, data analyst и machine learning scientist. Размышления полезны, и с точки зрения стратификации задач, и с точки зрения понимания как оценивать результат от каждого специалиста. Например, ставить KPI дата-инженеру или analytics engineer довольно бессмысленно, инженеры работают на основе тикетов, можно обеспечивая работу систем и инфраструктуры. А вот работу data scientist'ов можно и, некоторые утверждают, обязательно измерять в KPI. Но, здесь конечно, надо оговориться что всё это ролевое разделение в первую очередь относится к in-house командам, включая команды на аутстаффе. Для команд которые работают как внешние подрядчики существуют разные KPI для заказчики и внутри для руководства. Ссылки: [1] medium.com/data-mo…aac84a3c [2] benn.substack.com/p/metho…cal-work [3] https://hex.tech/blog/data-team-roi #data #datamarket #roi #kpi
    How to think about the ROI of data work

    In a way that makes you look smarter than your boss

    Medium
  • Ivan Begtin

    В рубрике полезных инструментов с открытым кодом для работы с данными Datasette [1]. Незаменим когда надо очень быстро и простым образом опубликовать данные так чтобы можно было их не просто скачать, но и связывать с другими данными, делать SQL запросы и просматривать онлайн. Инструмент автоматически создаёт интерфейс поверх набора данных и даёт возможности поиска по нему разными способами. Его особенность в том что он работает поверх базы SQLlite, которую также можно скачать. Примеры публикаций датасетов с помощью datasette: - global-power-plants.datasettes.com [2] - база электростанций по всему миру - fara.datasettes.com [3] - реестр инагентов в США (FARA) - covid-19.datasettes.com [4] - база кейсов по COVID-19 И многие другие. Интерфейс который создает datasette неидеален и лично мне он не нравится, но для многих он может быть и будет полезен. Ссылки: [1] https://datasette.io/ [2] https://global-power-plants.datasettes.com/ [3] https://fara.datasettes.com/ [4] https://covid-19.datasettes.com/ #datatools #opendata #data #opensource
  • Реклама

  • Ivan Begtin

    Не так давно я писал про распознавание классов данных в DataCrafter'е и про небольшой движок с открытым кодом metacrafter [1], но не все и не всегда понимают зачем это нужно и для чего вообще используются подобные инструменты и нужно понимание того что содержится в таблицах с данными. Я постараюсь об этом рассказать в подробностях. То что я ранее упоминал как классы данных, иногда называют метки данных (data labels), но самое распространённое название - это semantic type (семантический тип данных). В отличие от простых типов данных таких как числа, числа с плавающей запятой, строки, даты, бинарные блоки и так далее, семантические типы определяют смысл и предназначение именно этих данных. Смысл и предназначение как в содержании, так и в последующих вариантах применения. Например, типом поля может быть строка, а семантическим типом может быть: адрес, номер телефона, название организации или ФИО человека. Каждый из этих семантических типов имеет разный смысл и разные модели использования. Где-то это ссылка на справочные значения, где-то данные требующие расшифровки и декомпозиции, а где-то и метрики для последующего анализа и отображения. Многие инструменты умеют определять семантические типы весьма неплохо. Например, Talend ETL поддерживает несколько десятков семантических типов данных [2] что используется в преобразованиях данных. Некоторые семантические типы понимает и распознает Google DataStudio [3] что позволяет сразу размечать данные в наборе для разных видов визуализации. А в таком инструменте как Dataprep [4] семантические типы данных используются в задачах очистки наборов данных. И таких применений ещё много. Поэтому отвечая на вопрос: зачем это нужно, перечислю наиболе очевидные области применения: 1. Идентификации персональных данных в целях комплаенса и соответствия требованиям. 2. Автоматизация обработки данных включая (сопоставление схем, обогащение данных, автоматизация преобразований) 3. Обеспечение качества данных: автоматизация проверки на соответствие данных шаблонам и подсказки для инженеров QA. 4. Автоматизация документирования данных автоописанием полей данных на основе их смысла 5. Улучшение визуализации в BI системах за счёт того что система начинает понимать природу данных и предлагать разные способы их визуализации 6. Повышение находимости данных (data discoverability) через доп фильтры для поиска и через дополнительный способ навигации по данным. Наиболее остроактуальные темы - это повышение качества данных и идентификация персональных данных. Многие онлайн платформы, вроде Snowflake, автоматизируют идентификацию семантических типов. Ссылки: [1] https://github.com/apicrafter/metacrafter [2] help.talend.com/r/en-US…ic-types [3] developers.google.com/datastu…emantics [4] docs.dataprep.ai/user_gu…_df.html #data #datatools #dataconcepts
    GitHub - apicrafter/metacrafter: Metadata and data identification tool and Python library. Identifies PII, common identifiers, language specific identifiers. Full customizable and flexible rules

    Metadata and data identification tool and Python library. Identifies PII, common identifiers, language specific identifiers. Full customizable and flexible rules - GitHub - apicrafter/metacrafter: ...

    GitHub
  • Ivan Begtin

    Есть и другие новости, Налоговая служба США (IRS) законтрактовалась с компанием ID.me на работы по идентификации и распознаванию по лицам тех кто сдаёт личную налоговую отчетность онлайн. Об этом статья в Scientific American [1] со ссылкой на сайт IRS [2]. Главная причина - резкий всплеск мошенничества и преступлений связанных с подменой личности. Об этом в США был большой госдоклад за 2020 год [3] систематизирующий такие преступления. Отдельная тема упоминаемая в статье, о том что частная компания обеспечивает идентификацию людей для госоргана и опасения что нельзя отдавать такие критичные функции бизнесу. По моим наблюдениям, в России противоположная ситуация. Многих тревожит требование по биометрии именно потому что это делается как государственная система и сразу возникают страхи всеобъемлющей слежки. Ссылки: [1] www.scientificamerican.com/article…concerns [2] www.irs.gov/newsroo…lp-tools [3] www.ftc.gov/system/…2020.pdf #privacy #facialrecognition #biometrics #usa #irs
    Facial Recognition Plan from IRS Raises Big Concerns

    Government agencies are tapping a facial recognition company to prove you’re you

    Scientific American
  • Ivan Begtin

    ... Дмитрий Данилов сообщил, что в дальнейшем планируется расширить функции нового подразделения, поручив ему надзор за исполнением законодательства о защите персональных данных граждан и информации ограниченного доступа, в том числе хранящейся в автоматизированных информационных системах государственных органов, корпораций с госучастием, а также научных учреждений и организаций. Соответствующие возможности прокурорам открывает внесенный в Госдуму законопроект, позволяющий в рамках надзора получать персональные данные. Его уже одобрил думский комитет по безопасности и противодействию коррупции. В статье Коммерсанта [1] о появлении Отдела по надзору за исполнением законов в сфере информационных технологий и защиты информации внутри Генеральной прокуратуры РФ. Я бы ожидал в 2022 году больше уголовных дел в отношении системных интеграторов и появления аналогичных отделов в прокуратурах субъектов федерации, с фокусом на региональные ИТ. Ссылки: [1] https://www.kommersant.ru/doc/5216010 #digital #russia
    Искусственный интеллект попал под надзор

    Генпрокуратура взяла под контроль развитие «Цифровой экономики»

    www.kommersant.ru
  • Ivan Begtin

    В рубрике полезного регулярного чтения, Руководство по цифровому участию [1] от People Powered о том как выбирать платформу и как организовывать процесс участия граждан в принятии решений - как собирать обратную связь, как обеспечивать онлайн голосование и многое другое. Руководство есть и на русском языке в том числе. Авторы также составили матрицу из 50 платформ, с открытым кодом и коммерческих, из которых можно выбирать решение под свои задачи [2]. Я тут могу лишь вспомнить что с в России в 2010-2013 было несколько экспериментов соучастия граждан в цифровых моделях управления. Были сайты петиций (РОИ), систем обсуждения/публичной экспертизы нормативно-правовых документов, партисипаторной демократии и так далее. Но большая часть из них выродились или погибли. Прижились только: - системы жалоб (gorod.spb.gov.ru, gorod.mos.ru и аналогичные проекты) - систем комментариев без гарантии обратной связи (regulation.gov.ru) - инициативное бюджетирование (несколько региональных проектов) А вот в мире проекты общественного соучастия на взлёте уже несколько лет, их всё больше и они получают инвестиции и развиваются как общественные проекты. Ссылки: [1] https://ru.peoplepowered.org/digital-guide-home [2] airtable.com/shrxxpc…GX07UZDo #opengovernment #participation #opensource
    Введение в Руководство по платформам цифрового участия - People Powered

    Если вы хотите привлечь свое сообщество к работе с помощью цифровой платформы, это руководство для вас. Оно объясняет, что это такое, и показывает, как их выбрать, настроить и запустить.

    People Powered
  • Ivan Begtin

    В рубрике полезных инструментов работы с данными, low code инструменты с открытым кодом по превращению данных в приложения. - Budibase [1] позволяет строить простые приложения, поддерживает PostgreSQL, MySQL, MSSQL, MongoDB, Rest API и др. Кроме открытого кода есть облачная версия [2]. В примерах разного рода формы для заполнения. Написан на Javascript. - Tooljet [3] также позволяет делать простые приложения и также поддерживает много разных баз данных PostgreSQL, MongoDB, Elasticsearch и др., написан на Javascript. Также представлен открытым кодом и облачной версией [4] - N8N [5] автоматизация потоков задач и данных, с открытым кодом и удобным интерфейсом. Имеет много интеграций и не только с базами данных. Таких продуктов ещё десятки, low code платформы это одна из наиболее "горячих тем" в последние пару лет. Всё чаще они позиционируются как "постройте внутреннее приложение за минуты". Ссылки: [1] https://github.com/Budibase/budibase [2] https://budibase.com/pricing [3] https://github.com/ToolJet/ToolJet [4] https://tooljet.com/pricing [5] https://github.com/n8n-io/n8n #nocode #lowcode #platforms #tools
    GitHub - Budibase/budibase: Budibase is an open-source low-code platform for creating internal apps in minutes. Supports PostgreSQL, MySQL, MSSQL, MongoDB, Rest API, Docker, K8s 🚀

    Budibase is an open-source low-code platform for creating internal apps in minutes. Supports PostgreSQL, MySQL, MSSQL, MongoDB, Rest API, Docker, K8s 🚀 - GitHub - Budibase/budibase: Budibase is an...

    GitHub
  • Ivan Begtin

    О ГосТехе в канале Координация профанации вышло аж 3 публикации [1] [2] [3] где автор весьма дотошно разбирает историю ГосТеха в России. Что не значит что ГосТех совершенно бесмысленная история, но что означает что то как он запускается и публичные коммуникации вокруг вызывают очень много вопросов. Я скажу от себя лично, вне зависимости от того насколько в итоге архитектура Гостеха будет грамотной, а технические решения полезны, публичные коммуникации по нему проваливаются. Материалов в открытом доступе минимум, архитектурных сведений минимум, ответы на вопросы шаблонные и так далее. Публично вся эта инициатива подаётся _очень плохо_, как я писал ранее после их мероприятия в РАНХиГС, выглядело всё это демотивирующе и антихаризматично, даже не нейтрально уныло, а просто плохо. Ссылки: [1] https://telegra.ph/GosTeh-SHryodingera-02-10 [2] https://telegra.ph/GosTeh-SHryodingera-02-11 [3] https://telegra.ph/GosTeh-SHryodingera-02-13 #govtech #government #it
    Координация профанации

    Нелицеприятно и не взирая на лица - о госинформатизации, цифровой трансформации и профанах. Практически "Короли и капуста" - только с уклоном в госИТ Вопросы, критику, инсайды отправляйте на [email protected] ТГ: @CynicAdmin, @ExEx_IT

    Telegram
  • Ivan Begtin

    Я уже писал про содержание российского портала data.gov.ru [1] и выкладывал его дамп для тех кто хочет его исследовать [2]. Чтобы дополнительно объяснить что с ним не так нужны были сравнимые по уровню и масштабу каталоги данных и такие каталоги есть. В каталоге Humanitarian Data Exchange data.humdata.org опубликовано около 31 тысячи наборов данных, а в каталоге-агрегаторе OpenDataSoft data.opendatasoft.com размещено около 25,6 тысяч наборов данных. Очень близкие цифры с data.gov.ru где опубликовано 26 тысяч наборов данных и вполне можно сравнивать. Поскольку я непрерывно скачиваю каталоги данных, могу приводить цифры, не всегда финальные, но уже показательные Так вот, предварительные и уже показательные цифры: - data.gov.ru - 100% наборов данных, 26 тысяч наборов, всё вместе 29GB - data.humdata.org - 205GB объём уже скачанных 21% наборов данных (6600), ожидаемый итоговый объём 950-1000ГБ - data.opendatasoft.com - 145 GB объём 40% уже скачанных данных, ожидаемый итоговый объём около 300-350GB Откуда такая разница и почему на российском национальном портале данных их так мало? Есть 3 основные причины: 1. Низкая интеграция портала с государственными информационными системами, только на портале электронного бюджета размещаются сотни гигабайт данных. 2. Полное отсутствие геоданных, в то время как значительная часть данных на других порталах - это Shape-файлы, используемые в геопродуктах. 3. Формальное раскрытие данных "из под палки" и по белому списку. Когда есть обязательный перечень бессмысленных требований по публикации в форматах открытых данных вакансий или списков подведов и, как результат, в виде открытых данных публикуются CSV файлы в 1-2 строки или и вовсе пустые. И ещё для сравнения, на портале открытых данных Великобритании, data.gov.uk, только CSV файлов без сжатия опубликовано 222ГБ. Остальных скачанных данных у меня нет на руках, но я бы оценил объём остальных данных как примерно столько же. А самые большие данные там по госзакупкам и анонимизированные цифры статистики по выписке рецептурных лекарств по районам. Уникальные данные, мало где в мире публикуемые. Какой вывод можно из всего этого сделать? К сожалению всё те же, довольно бессмысленно пользоваться российским федеральным порталом открытых данных, проще извлекать данные из первоисточников, сайтов органов власти и региональных порталов данных. Ссылки: [1] https://t.me/begtin/3508 [2] https://hubofdata.ru/dataset/datagovru-20220202 #opendata #dataportals #data
    Ivan Begtin

    Я много критиковал и критикую российский федеральный портал открытых данных data.gov.ru [1], но как-то без цифр. Сейчас, когда наконец-то докачались все доступные данные 26490 наборов данных с этого портала я могу цифры привести и дать некоторую картину его текущего состояния: 1. 29 гигабайт - это общий объём данных в федеральном портале открытых данных data.gov.ru. Большая часть этих данных несжаты, после сжатия их объём составит около 15-20 гигабайт, а может быть и меньше, сжатие этого архива ещё не закончилось. 2. Из них 6.8 гигабайт - это однократный слепок данных в ZIP архиве из системы ФИАС не обновлявшийся с октября 2019 года [2]. Вернее ссылка на этот слепок на сайте ФНС [3]. 3. Всего на 5 крупнейших наборов данных приходится 50% хранимого объёма. Это данные ФИАС, вакансий и юр. лиц Роструда и сведения о малом и среднем бизнесе с сайта ФНС. 4. 3839 наборов данных имеют размер менее 1 килобайта. Это 14.5% всех наборов данных, всех уровней власти. Федерального, регионального и муниципального. 5. На самом…

    Telegram
  • Ivan Begtin

    Несомненно полезная визуализация онтологии инициатив Data and AI for Good [1]. Автор Jake Porway, сооснователь проекта DataKind просистематизировал несколько десятков инициатив по неплохой методологии [2] собрал вот такую визуальную картину. Если кратко, то у инициатив "за всё хорошее" в данных и в ИИ есть два вектора: - уменьшить ущерб - увеличить пользу Думают об этом, создают проекты, сообщества, инициативы, регулирование и кодексы очень многие. С разными подходами и этическими базисами. Ещё до рисования этой картинки и текста, летом 2021 года автор собирал кластеры участников процесса и получилось неплохо. Ссылки: [1] data.org/news/a-…for-good [2] data.org/wp-cont…INAL.pdf [3] docs.google.com/documen…Q1I/edit #data4good #ai4good #data #policies
  • Ivan Begtin

    В рубрике интересных наборов данных, Google Mobility Report, данные о передвижении жителей стран во время COVID-19. Компания опубликовала и обновляет файлы в виде CSV файла по всему миру, CSV файлов по странам и в виде PDF отчетов по каждой стране [1]. Всего данных на 844 МБ в распакованном виде, данные по России тоже есть. Одно ограничение в том что условия использования указанные там - это условия использования Google [2], а это, конечно, не свободная лицензия. Тем не менее практическое применение этим данным вполне возможно найти. Ссылки: [1] https://www.google.com/covid19/mobility/ [2] https://policies.google.com/terms?hl=ru #opendata #data #covid19

    See how your community is moving around differently due to COVID-19

    COVID-19 Community Mobility Report
  • Ivan Begtin

    Любопытный продукт про работу с данными с открытым кодом JuiceFS [1], облачная файловая система с поддержкой многих облачных провайдеров и предоставляющая S3 совместимый интерфейс. Базовая архитектура продукта в том что все метаданные хранятся в Redis или в другом key-value хранилище, а файлы в S3 совместимом хранилище файлов. Никакой магии, но полезный рабочий инструмент. Авторы пошли тем же путём что я уже часто описываю - сделать популярный open source продукт и привлекать венчурные инвестиции на облачное решение [2]. Другой интересный продукт схожего типа Seaweedfs [3] также создающий онлайн хранилище с поддержкой десятка если не больше хранилищ метаданных собственным хранилищем файлов. Что интересно, как и другие продукты по распределённому хранению файлов, он развивается в сторону объектного хранения. Фактически key-value хранилища для блобов (кусков данных по которым не осуществляется поиск, например бинарных файлов). А один из самых известных и успешных проект среди распределённых хранилищ - это MinIO [4], они подняли $126M инвестиций на S3 совместимое ПО и это не облачный продукт, а именно серверное ПО, покупатели, в основном, хостеры и корпорации создающие публичные и приватные файловые хранилища. В основе их же продукт с открытым кодом по AGPL3 лицензией. Файловые хранилища - это "нижняя" часть инфраструктуры работы с данными. Иногда можно полностью обойтись облачными решениями, а иногда надо разворачивать собственное хранение первичных и промежуточных файлов. Ссылки: [1] https://github.com/juicedata/juicefs [2] http://juicefs.com/ [3] https://github.com/chrislusf/seaweedfs [4] https://www.min.io [5] www.crunchbase.com/organiz…inio-inc #data #datainfrastructure #storage #startups
    GitHub - juicedata/juicefs: JuiceFS is a distributed POSIX file system built on top of Redis and S3.

    JuiceFS is a distributed POSIX file system built on top of Redis and S3. - GitHub - juicedata/juicefs: JuiceFS is a distributed POSIX file system built on top of Redis and S3.

    GitHub
  • Ivan Begtin

    В качестве регулярного напоминания о том где искать данные и какие каталоги данных существуют: - Хаб открытых данных (hubofdata.ru) создан на базе системы каталогов данных CKAN нами (@infoculture) ещё до появления государственных порталов данных. Можно использовать для загрузки данных, а нами используется как хранилище метаданных к архивам, причём не только данных, но и веб-сайтов. - Данные НКО (ngodata.ru) портал созданный нами для того чтобы НКО могли бы публиковать данные по результатам своей работы. Задумка была хорошая, но заинтересованность НКО в распространении своих данных мы явно переоценили. В то же время немало данных Инфокультуры опубликовано и там тоже. - Каталог каталогов данных (datacatalogs.ru) - создан как агрегатор метаданных о каталогах данных. Охватывает, наверное, почти все каталоги данных в России и о России, а также некоторые цифровые репозитории где должны быть данные (в том числе), например, репозитории научных публикаций. - DataCrafter (data.apicrafter.ru) - каталог данных созданный в рамках нашего коммерческого проекта APICrafter. Значительная часть данных открыта и общедоступна. Всё ещё в бета режиме и пока используется для технологических экспериментов в основном. Вроде того что я постоянно рассказываю о классификации данных и разметки типов полей данных по их смыслу (кодам ИНН, ФИО, персональным данным, справочникам и тд) Всё это то что находится в открытом доступе, а также много данных которые мы постоянно собираем и до которых _не доходят руки_, потому что собрать данные != документировать данные != привести данные удобный вид. #opendata #dataportals #datasets #datadiscovery
    Каталог данных

    Проект представляет собой базу систематизированных источников данных, куда входят государственные порталы, наборы открытых данных, академические репозитории и иные источники, потенциально интересные для всех, кто работает с данными.

    www.datacatalogs.ru
  • Ivan Begtin

    Полезное чтение про разное - How often do people actually copy and paste from Stack Overflow? Now we know. [1] о том как часто программисты копируют тексты со Stack Overflow. Мини-исследование от команды проекта собиравших данные о копировании с помощью отслеживания фактов копирования в JavaScript коде. Если кратко - копируют много и посты/ответы с хорошей репутацией. - The next billion programmers [2] рассуждения всё того же Benn Stancil из стартапа Mode о том что самый главный продукт для переделки или пересоздания - это Excel. У Бена хорошие рассуждения практически во всех его текстах, он уходит куда дальше чем просто продвижение Mode и дискуссий вокруг хайпов вокруг данных, а рассуждает по общеотраслевые проблемы. Excel - это, действительно, с одной стороны гениальное, а с другой тяжкое наследие. - Six Reasons Why the Wolfram Language Is (Like) Open Source [3] ноябрьский текст от Jon McLoone, директора по коммуникациям и стратегии в Wolfram, о том почему модель открытого кода не подходит для ключевых технологий Wolfram. Для тех кто не знает, Wolfram Mathematica один из лучших продуктов для технических вычислений, а Wolfram Alpha один из лучших продуктов поиска ответов на вопросы со способностью давать ответы в технических дисциплинах. Но все эти продукты с закрытым кодом, включая их Wolfram Language и многие не используют именно из-за закрытости и замкнутости экосистемы Wolfram. Стоит почитать чтобы понимать позицию тех кто делает хорошие продукты и не может поменять бизнес модель в сторону открытости и поговорить о том к чему это приведет. - Tableau Data Catalog: Let’s do the jigsaw puzzle! [4] команда разработчиков пытаются построить каталог данных на базе Tableau. На мой взгляд это не самый правильный путь, но активным пользователям Tableau может оказаться полезным. - Understanding of metrics store [5] полезный обзорный текст про хранилища метрик, как лучше их организовать, зачем и кому они нужны. Лично у меня metrics store четко ассоциируется с Headless BI, и разделением аналитических показателей на подсчет, хранение и интерфейс. - Snowflake Data Classification Now Available in Public Preview [6] в Snowflake анонсировали технологии классификации данных для данных загружаемых пользователями, но потом почему-то статью убрали и осталась она только в гугл кеше. Технология практически та же что у нас в DataCrafter'е [7] и то что я недавно анонсировал в виде утилиты metacrafter [8] с открытым кодом. Разница в том что у Snowflake это встроено в систему SQL запросов и находится прямо внутри их движка. Ссылки: [1] stackoverflow.blog/2021/12…-we-know [2] benn.substack.com/p/the-n…grammers [3] blog.wolfram.com/2021/11…n-source [4] medium.com/iadvize…3e674622 [5] medium.com/kyligen…341e4c25 [6] https://webcache.googleusercontent.com/search?q=cache:61aCFi3onBwJ:https://www.snowflake.com/blog/data-classification-now-available-in-public-preview/+&cd=1&hl=fr&ct=clnk&gl=de&client=firefox-b-d [7] https://data.apicrafter.ru/class [8] https://github.com/apicrafter/metacrafter/ #reading #data #tech
    How often do people actually copy and paste from Stack Overflow? Now we know.

    April Fool's may be over, but once we set up a system to react every time someone typed Command+C, we realized there was also an opportunity to learn about how people use our site. Here’s what we found.

    Stack Overflow Blog
  • Реклама

  • Ivan Begtin

    Команда Superconductive стоящая за Great Expecations open source продуктом по контролю качества данных подняла $40M инвестиций на создание облачного продукта [1] Можно сказать что у инструментов работы с данными просто заметнейший тренд на то что вначале команды создают востребованное open source ПО, а потом берут инвестиции на облачную версию. Главное, я напомню, не забывать судьбу CloverETL которые начинали с open source продукта, а потом убили его ради корпоративной версии и таких примеров в настольном и сервером ПО немало, а у open source + облачного другие особенности, главная из которых в том что авторы часто потом добавляют в open source решение зависимость от своей облачной инфраструктуры. Ссылки: [1] techcrunch.com/2022/02…ity-tool #opensource #dataquality #startups #investments
    Superconductive, creators of Great Expectations, raises $40M to launch a commercial version of its open source data quality tool no

    Data quality — the practice of testing and ensuring that the data and data sets you are using are what you expect them to be — has become a key component in the world of data science. Data may be the “new oil”; but if it’s too crude, you may not be able to use […]

    TechCrunch
  • Ivan Begtin

    В блоге Open Ownership пишут о том что на декабрьской конференции UNDC (Управлении ООН по противодействии коррупции) приняли резолюцию [1] о развитии в сторону раскрытия сведений о конечных владельцах компаний. Обратите внимание что именно о конечных владельцах (beneficial owners), а не учредителям юр. лиц. Сведения об учредителях не везде, но много где доступны за деньги или бесплатно, а вот сведения о конечных владельцах публикуются лишь единицами стран. Напомню что в России сведения о конечных владельцах публикуются только кредитными организациями и то, в виде схем, в немашиночитаемом виде. Ссылки: [1] www.unodc.org/unodc/e…ons.html #opendata #un #anticorruption
  • Ivan Begtin

    В Forbes вышла моя колонка [1] по регулировании Метавселенных в России Вначале я хотел добавить юмора, описать будущее чего-то вроде Росметаконтроля или Федеральной службы виртуального патриотизма или Министерства внутривиртуальных дел, но в какой-то момент юмор засбоил и получился серьёзный текст про усиление госконтроля. Ссылки: [1] www.forbes.ru/mneniya…k-ugrozu #privacy #vr #ar #metauniverses #reading
    Метавселенные под контролем: почему новые технологии в России воспринимают как угрозу

    Российские власти задумались о том, как регулировать метавселенные и виртуальную реальность. Чиновники видят риски не столько в технологиях, как таковых, сколько в распространении информации. Метавселенные дадут гражданам дополнительные возможности д

    Forbes.ru