Обложка канала

Клуб CDO. Страница 33

1243 @cdo_club

Сообщество профессионалов в области работы с данными и ИИ

  • Клуб CDO

    Data Governance: The Definitive Guide: People, Processes, and Tools to Operationalize Data Trustworthiness

    Data Governance: The Definitive Guide: People, Processes, and Tools to Operationalize Data Trustworthiness eBook : Eryurek, Evren, Gilad, Uri, Lakshmanan, Valliappa, Kibunguchy-Grant, Anita, Ashdown, Jessi: Amazon.co.uk: Kindle Store

    Amazon
  • Клуб CDO

    Архитектура реальной системы машинного обучения

    Чтобы понимать, как работают системы машинного обучения, нужно знать, из каких компонентов они состоят и как они связаны друг с другом. Команда VK Cloud Solutions перевела статью об архитектуре...

    Хабр
  • Клуб CDO

    🤿 Глубокое погружение в визуализацию данных 🌊 Недавно прочитал объемную книжку Hands-On Data Visualization про визуализацию данных. Чтобы сэкономить вам время, структурировал самые полезные главы из книги в этом посте. ▪Суперский список ресурсов по поиску датасетов ▪ Классная глава про очистку данных и про функцию Smart Cleanup в Google ▪Инструмент Tabula для извлечения таблиц из pdf Инструмент Open Refine: мощная вещь для очистки данных, которую я изучал в Georgia Tech ▪Важные правила построения графиков: ▪Клевые мануалы по созданию чартов в DataWrapper ▪Полезные принципы дизайна таблицСерия мануалов по созданию графиков на Chart.js ▪Любопытная глава по определению лжи на графиках ▪Как лгать с помощью графиков и как лгать с помощью карт ▪Полезный прием: выставление акцентов в данных при сторителлинге ❕Не мог не выделить отдельно главу про важность отличий медианы и среднего следующей старой шуткой: There’s an old joke that when a billionaire walks into a room, everyone becomes a millionaire—on average—but the median barely changes. Сохраняйте себе этот список, оставляйте ❤️, если хотите больше контента про датавиз!
  • Реклама

  • Клуб CDO

    Как мы писали книгу по управлению данными. Часть 2

    В предыдущей нашей публикации, «Как мы писали книгу по управлению данными» мы подробно рассказали о всех нюансах создания книги «Ценность Ваших Данных» [2] – от замысла до работы с издательством. В...

    Хабр
  • Клуб CDO

    Максим Фёдоров о проблемах применения искусственного интеллекта Ректор "Сириуса" и известный специалист по ИИ дал интересное интервью Коммерсанту. Важнейшие тезисы: - проблема неустойчивости решений обученных моделей: жизнь обязательно богаче обучающей выборки, поэтому ошибки по результатам использования ИИ-продуктов гарантированы, вопрос лишь в их времени и частоте, ‐ закладки через данные: угрозы кибербезопасности (например, неожиданный разгон автономного автомобиля, запланированное искажение распознавания лица) теперь могут создаваться манипуляциями на обучающей выборке и присутствовать в том числе в популярных открытых наборах данных, которым поэтому не стоит полностью доверять, - системы социального рейтинга: не просто репрессивны, но ещё и антинаучны, поскольку основаны на ложном предположении о возможности выразить сложную социальную реальность моделью с конечным числом параметров.
    «Возникла иллюзия, что если у нас будет достаточно данных, мы сможем решить любую задачу»

    Ректор «Сириуса» Максим Федоров об этике и искусственном интеллекте

    Коммерсантъ
  • Клуб CDO

    Дайджест статей 23/07/2022 Сегодня статей не много, часть отложил прочитать повнимательнее и на следующей неделе достойные отдельно опубликую Data Quality: новые правила https://habr.com/ru/company/vk/blog/674830/ Перенос данных с Oracle на PostgreSQL: основные этапы, несовпадающие типы и форматы данных habr.com/ru/comp…g/676792 Why Do You Need Managed AI? dzone.com/article…naged-ai
    Data Quality: новые правила

    В нашем мире проблемы с данными делятся на два типа: предсказуемые (известные неизвестные) и непредсказуемые (неизвестные неизвестные). Вот какой комплексный подход применяют лучшие специалисты по...

    Хабр
  • Клуб CDO

    Вот, перед выходными, достаточно большой и детальный материал на тему "наличия у сверхбольших ML моделей сознания" . Наверное все уже слышали о нашумевшем случай в Google, когда товарищ, долго беседующей со сверхбольшой диалоговой моделью LaMDA, пришел к заключению о наличии у ее сознания. Об этом много писали, я тут не постил на эту тему ничего, как то не успевал погрузиться более детально, что там произошло у товарища с моделью, а сам факт наличия/отсутствия сознания у математической функции обсуждать не хотелось. Вот, наконец, подоспели хорошие материалы от специалистов, которые можно почитать. Статья на Хабре: habr.com/ru/comp…g/674428 И еще вот еще хорошая дискуссия с участием Григория Сапунова - https://www.youtube.com/watch?v=Az0tnvNy0Es&list=WL&index=6&t=1s
    Что мы действительно (не)знаем о наличии сознания у сверхбольших нейросетей?

    В последнее время чаще стали появляется новости о том, что тот или иной эксперт в области ИИ заявил про появление у машины сознания. То Илья Суцкевер, директор по науке в OpenAI напишет о том, что...

    Хабр
  • Клуб CDO

    Туториал по фреймворку для программирования датасетов Вот еще одна полезная, практическая статья про работу с данными. В ней досказывается о проекте Сноркель - фреймворке для программирования данных (data programming). Он реализует подход который заключается в использовании разных эвристик и априорных знаний для автоматической разметки датасетов. Проект стартовал в Стэнфорде как инструмент для помощи в разметке датасетов для задачи information extraction, а сейчас разработчики делают платформу для пользования внешними заказчиками. https://habr.com/ru/company/mts_ai/blog/673786/
    Ныряем со Сноркелем в море данных. Туториал по фреймворку для программирования датасетов

    Привет. Я Игорь Буянов, старший разработчик группы разметки данных MTS AI. Я люблю датасеты и все методы, которые помогают их делать быстро и качественно. Недавно рассказывал о том, как делать...

    Хабр
  • Клуб CDO

    Качество данных важная тема. Вот интересная статья от команды Ростелекома про опыт разработки модуля DQM. habr.com/ru/comp…g/675554
    Контроль качества данных и точка. Как мы строили модуль DQM с нуля

    Всем привет! Меня зовут Андрей, я занимаюсь процессами контроля качества данных в DataOffice Ростелекома. В статье поделюсь опытом создания модуля контроля качества данных, с какими трудностями мы...

    Хабр
  • Клуб CDO

    Хорошо известно, что модели машинного обучения отлично справляются с широким кругом задач. Чтобы построить доверие к процессу ИИ, необходимо понять, как работают эти модели. Однако исследователи до сих пор не совсем понимают, как модели AI/ML используют те или иные аспекты или приходят к определенным выводам из-за сложности функций и алгоритмов, используемых для обучения этих моделей. Недавнее исследование, проведенное командой MIT, создает таксономию, чтобы помочь разработчикам создавать "признаки" для ML моделей, которые их целевой аудитории будет легче понять. В своей статье «Потребность в интерпретируемых функциях: мотивация и таксономия» они определяют свойства, которые делают функции более интерпретируемыми для создания таксономии. Они сделали это для пяти различных типов пользователей — от профессионалов в области искусственного интеллекта до тех, на кого может повлиять прогноз модели машинного обучения. Они также дают советы о том, как разработчики могут сделать функции более доступными для широкой публики. Новость: www.marktechpost.com/2022/07…nd-users Само описание работы: kdd.org/explora…ised.pdf
  • Клуб CDO

    Как Business Intelligence «купается» в озёрах данных: практика платформы «Форсайт»

    Часть 1. Технология гетерогенных ROLAP-кубов Всем привет. В этой публикации мы начнем рассказ о том, как наша BI-платформа «Форсайт» работает с данными. Как организовано взаимодействие платформы с...

    Хабр
  • Клуб CDO

    Коллеги, 26 июля заканчивается набор в магистратуру НИУ ВШЭ по управлению продуктом и маркетингом на основе данных. Это единственная программа государственного высшего образования, студенты которой получают доступ к симулятору GoPractice! и всем материалам конференций Aha! и Матемаркетинг. Магистратура очная, она длится два года. В результате студенты получают hard skills и практику для того, чтобы после выпуска стать менеджерами продукта, маркетологами или продуктовыми аналитиками. Советую посмотреть полезные демо-воркшопы от спикеров этой магистратуры, чтобы самим сделать вывод: про автоматизацию лояльности от Арсения Уланова из Яндекса, про провалы дата-проектов, про роль продакта от действующих и бывших CPO Aviasales, SkyEng, Юлы. Курирует магистратуру уже третий год Рома Нестер (основатель Segmento, профессор ВШЭ). В этом году в магистратуре есть бюджетные места. Чтобы поступить, вам нужно собрать портфолио и пройти собеседование (подробнее https://bit.ly/postuplenie2022).
  • Клуб CDO

    Внимание, очень большая, детальная статья "Federated Learning for Privacy-Aware Human Mobility Modeling". Спешу поделиться, но сам еще в деталях не ознакомился. Успел посмотреть только по диагонали. www.frontiersin.org/article…046/full
    Federated Learning for Privacy-Aware Human Mobility Modeling

    Human mobility modeling is a complex yet essential subject of study related to modeling important spatiotemporal events, including traffic, disease spreading, and customized directions and recommendations. While spatiotemporal data can be collected easily via smartphones, current state-of-the-art deep learning methods require vast amounts of such privacy-sensitive data to generate useful models. This work investigates the creation of spatiotemporal models using a Federated Learning (FL) approach—a machine learning technique that avoids sharing personal data with centralized servers. More specifically, we examine three centralized models for next-place prediction: a simple Gated Recurrent Unit (GRU) model, as well as two state-of-the-art centralized approaches, Flashback and DeepMove. Flashback is a Recurrent Neural Network (RNN) that utilizes historical hidden states with similar context as the current spatiotemporal context to improve performance. DeepMove is an attentional RNN that aims to capture human mobility's…

    Frontiers
  • Клуб CDO

    Вчера был пост про data wrangling, если кто не заглядывал внутрь то вот ссылка на интересный инструмент очистки данных. Я раньше знал только OpenRefine - прям замечательная вещь когда надо подготовить датасет для анализа, а вот оказывается еще есть подобные решения. https://www.trifacta.com
    The Trifacta Data Engineering Cloud

    Transform your data. Transform your business.

    Trifacta
  • Клуб CDO

    Друзья, всем привет от DeepPavlov.ai 👋🏻 Мы создаем открытый стек технологий разговорного ИИ, чтобы упростить разработку чат-ботов и виртуальных помощников. В этом месяце мы проведем наш традиционный ежемесячный вебинар на русском языке, на котором мы поделимся нашими знаниями и опытом в области разговорного ИИ. Вебинары бесплатны для всех желающих! 🔥28 июля в 19:00 приглашенный гость Борис Галицкий, ассоциированный сотрудник лаборатории Интеллектуальных систем и структурного анализа НИУ ВШЭ, основатель нескольких стартапов в области ИИ, профессор ANECA, а также бывший сотрудник Oracle, представит доклад на тему “Дискурсивный анализ текста для организации диалога”. 🤖Сделать диалог с чат-ботом логичным и интересным — важнейшая задача области Conversational AI. Для этого применяются самые разные подходы, и один из них — дискурсивный анализ текста. Его идея состоит в том, чтобы чат-бот помог пользователю сфокусироваться лишь на каком-либо предложении из всего текста. В дискурсивном дереве текст разбивается на части, связанные логическими отношениями, и чат-бот направляет по ним пользователя, развивая диалог. Например, это могут быть временные (temporal) отношения, когда пользователя наверняка заинтересует, что будет после описанного события или что было до него. На нашем вебинаре Борис Галицкий подробно расскажет о способе управления ходом диалога в чат-боте на основе дискурсивного анализа текста. 📌Зарегистрироваться можно здесь. Мы приглашаем всех заинтересованных в развитии разговорного ИИ!
    Webinar Sign Up Form

    A simple form with two fields such as name and email address.

    deeppavlov.ai
  • Реклама

  • Клуб CDO

    The-Big-Book-of-Data-Observability.pdf

    application/pdf
  • Клуб CDO

    И еще одна статья про обеспечение качества данных, точнее, как это названо в статье "выпас данных". Ранее я такого термина не встречал, надо отметить. На английском это "Data Wrangling". Wrangle - пасти стадо, что не знал. Джинсы отсюда называются похоже :) Короче как обычно, при переводе с русского обратно, становится понятно, что хотел сказать автор :) Как пишут авторы, выпас данных отличается от очистки данных тем, что она не ограничивается удалением неточных и неактуальных данных. При обработке данные более тщательно преобразуются, переформатируются и подготавливаются для последующего использования. В статье не только описываются базовые шаги процесса подготовки данных, но и рассматриваются инструменты поддержки этого процесса. В общем читаем тут: https://habr.com/ru/company/piter/blog/675796/
    Что такое выпас данных и почему он необходим?

    Когда речь идет об анализе данных , результаты хороши лишь настолько, насколько хороши данные. И даже если на вашей стороне миллионы значений данных, и вы вооружены искусственным интеллектом и...

    Хабр
  • Клуб CDO

    К критике законопроекта об отключении алгоритмов присоединились стартапы Технологические стартапы, которые разрабатывают рекомендательные алгоритмы для сайтов и цифровых сервисов, выступили против законопроекта, дающего пользователям возможность их отключать. В текущей версии под действие документа попадают любые приложения и интернет-сайты вне зависимости от размера аудитории. Фонд развития интернет-инициатив (ФРИИ) предлагает ввести исключение для сервисов персонализированных рекомендаций или ограничить круг субъектов регулирования соцсетями и видеохостингами. Но последние тоже резко против новых требований. Авторы инициативы обещают учесть все опасения и доработать ее. #Ъузнал