Обложка канала

Клуб CDO. Страница 40

1243 @cdo_club

Сообщество профессионалов в области работы с данными и ИИ

  • Клуб CDO

    тем, кто как и все, пропустил Highload++, вот ссылка на запись трансляции 🙂 https://youtu.be/t-4P46qyJcc
    Трансляция HighLoad++ Foundation, 13.05.2022. Зал 1. Терминус

    HighLoad++ Foundation — крупнейшая в России профессиональная IT-конференция. https://highload.ru/foundation/2022 Расписание - https://highload.ru/foundation/2022/schedule 🔥В программе — более 130 докладов, каждый из которых решает конкретную задачу. Но конференция — это не только доклады. На HighLoad++ Foundation можно пообщаться с топами IT-индустрии и найти ответы на свои вопросы. 13 и 14 мая 2022 г. в Крокус-Экспо! -------- Нашли ошибку в видео? Пишите нам на [email protected]

    YouTube
  • Клуб CDO

    По ссылке доступна бесплатная книга по алгоритмам. Эта книга составлена из документации Stack Overflow. В книге детально описываются (с объяснениями и картинками) большое количество основных алгоритмов computer science. https://books.goalkicker.com/AlgorithmsBook/
    Free Algorithms Book

    Getting started with algorithms, Algorithm Complexity, Big-O Notation, Trees, Binary Search Trees, Check if a tree is BST or not, Binary Tree traversals, Lowest common ancestor of a Binary Tree, Graph, Graph Traversals, Dijkstra’s Algorithm, A* Pathfinding and A* Pathfinding Algorithm

    Goalkicker
  • Клуб CDO

    Поздравляю всех победителей премии! Очень важная и нужная премия!
  • Реклама

  • Клуб CDO

    Вручил премию за «Обеспечение качества данных» команде Теле2 !
  • Клуб CDO

    Прямо сейчас начинается премия Data Awards 22
  • Клуб CDO

    ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ Индекс 2021 года Изучил свежий отчет ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ Индекс 2021 года, вот несколько моментов, которые при прочтении вызвали внутри отклик и мои комментарии по ним: "91,2 % vs 89,8% SuperGLUE" - пока одна половина человечества радуется, что модели ИИ опережают человека в "понимании" текста и ответах на вопросы "о прочитанном материале" другая половина утверждает, что никакого "понимания" внутри моделей ИИ нет и что модели учатся не понимать текст, а "проходить конкретные тесты", в чем, на мой взгляд, есть большая доля правды. "№1 Китай стал лидером в Q1" - о, Китай таки перегнал Америку. поздравления. "Количество публикаций от российских исследователей стабильно растет, но все еще остается на уровне 1% от мировых. Россия в этом рейтинге поднялась в 2021 г. с 22 места на 18-е. Три ведущих университета — Сколтех, НИУ ВШЭ, МФТИ ответственны за 82% всех публикаций на конференциях A*" - ну что же - проклятие 1% для нас так и остается пока непреодолимым. по целому ряду показателей, Россия показывает везде стабильно 1% от мирового рынка. "Основной сегмент рынка ИИ в России — это Анализ данных, который достиг 61,2%. Сегмент NLP занимает 32,8%. Увеличение сегментов NLP и анализа данных обусловлено ростом выручки компании Яндекс, которую мы отнесли к этим двум сегментам." - ну вот тут прям очень натянуто - по всей видимости просто взяли всю выручку Яндекса и сказали, что это все NLP - ну это ж не так, как так можно то? Выручка Яндекса - реклама. NLP там внутри конечно есть, но так что бы прям ставить это в эквивалент? Извините. "Основным сегментом для венчурных инвестиций являются компании здравоохранения, на них приходится почти пятая часть общего финансирования." - вот это интересно. всегда исторически доминировали в инвестициях более "бизнесовые" сегменты, а здравоохранение, наоборот, сильно отставало, а теперь вышло в лидеры. Интересный тренд. "Однако в России мы наблюдаем обратный тренд. В 2021 г. инвестиции в ИИ проекты в области здравоохранения составили всего 5,4 млн $, что в 3,2 раза меньше чем в 2020 г., когда объем таких инвестиций составил 17,2 млн $." - мы идем своим путем. "4 место в мире занимает Россия по уровню компетенций в Data Science" - а вот инженерная составляющая у нас остается стабильно высокая, хотя и не а ТОП-3 "46 млрд ₽ Оценка рынка больших данных в России в 2021 г." - вот тут немного термин смутил, "объем рынка данных" тут = "объем решения для работы с данными", то есть инструментарий, инфраструктура и тд. интересно было бы посмотреть на динамику самого рынка данных, но в отчете ее нет. https://aireport.ru/ai_index_russia-2021
    AI Report - Итоги 2021

    Альманах Искусственный Интеллект №10. Итоги 2021

    aireport.ru
  • Клуб CDO

    Domino Data Lab announces latest MLops platform to satisfy both data science and IT В мире решений для MLOps, так же как в DataOps и Data Governance, наблюдается активный рост количестве решение и развитие платформ. Вот очередная новость - компания Domino Data Lab анонсировала новый выпуск своей MLOps платформы Domino. Интересные особенности новой версии: - Поддержка виртуализации GPU и инфраструктуры обучения моделей - Поддержка RAPIDS, TensorFlow, PyTorch, and CUDA - Интеграция с Git Основной задачей MLOps решений - упрощение организации процесса по разработке ML моделей, управление из жизненным циклом, версиями, инфараструктурой для обучения и тд. Думаю, что каждая компания, которая ставит своей задачей повышение своей зрелости в процессах работы с данными, должна обратить внимание на эти средства автоматизации. venturebeat.com/2022/05…e-and-it
    Domino Data Lab announces latest MLops platform to satisfy both data science and IT

    Domino Data Lab CEO Nick Elprin announced the enterprise MLOps leader’s latest platform, which includes 12 new capabilities meant to allow data science and IT teams to develop and deploy more models faster; reduce data and infrastructure complexity and costs; and extend autonomous model performance monitoring to Snowflake’s Data Cloud.

    VentureBeat
  • Клуб CDO

    Коллеги, 26 мая состоится второй оффлайн митап наших друзей - NoML Community (https://t.me/noml_community). В программе доклады о различных аспектах построения ML платформ и выстраивания MLOps процессов: - Артём Трофимов, Руководитель команды разработки ʎzy, Yandex Cloud “ʎzy - фреймворк для запуска произвольных (ML) задач на кластере” - Григорий Шутов, Архитектор направления ModelOps, GlowByte Advanced Analytics ”ML платформа на базе open source компонентов” - Данил Сивцов, Старший ML-инженер платформы ML Space, SberCloud ”Как построить MLOps из open source на примере платформы ML Space” - Все желающие могут присоединиться к панельной дискуссии: “От MLOps к ModelOps: зачем нужно управлять процессами жизненного цикла моделей?” Место проведения: Loft Hall #3 Grace & Secret, ул. Ленинская Слобода 26 стр. 15. Сбор гостей в 17:30. Для тех, кто не сможет присоединиться очно, будет онлайн трансляция Детальная программа и регистрация по ссылке: https://clck.ru/hH2JR
    NoML Community

    NoML: Not Only ML=) Обсуждаем не только ML и нейронки, а делимся опытом как решать реальные задачи бизнеса с помощью математики. Новостной канал https://t.me/noml_digest Канал с вакансиями https://t.me/noml_jobs Согласование объявлений @psnurnitsyn

    Telegram
  • Клуб CDO

    Методика машинного обучения Human-in-the-Loop Всем известно, что для разработки ИИ требуется не только большая вычислительная мощность, но и участие большого количества людей, тк алгоритмам ML требуется большое количество размеченных данных для обучения. Есть даже утверждение, что внедрение ИИ в бизнес не только не уменьшает количества рабочих мест, но наоборот, создает дополнительные рабочие места. Индустрия разметки данных активно растет и развивается. Более того, разметка данных - это не конечный акт, которые надо проделать перед обучением моделей, а постоянная практика, которая выполняется на протяжении всего жизненного цикла модели. В данной статье хорошо описываются подводные камни и лучшие практики непрерывной разметки данных. https://habr.com/ru/post/596353/
  • Клуб CDO

    Смотрю тут потихоньку лекции MIT курса по Blockchain. Ребята из Cryptus очень неплохо перевели их на русский язык. Так что если хотите разобраться в bitcoin и всем, что его окружает, не только в плане технологий, то и регулирования, места в экономике и в целом ознакомиться со всем спектром мнений относительно blockchain - посмотрите на досуге. www.youtube.com/playlis…playlist
  • Клуб CDO

    Framework for Data Preparation Techniques in Machine Learning Очень хороший материал по теме подготовки данных для использования в моделях машинного обучения. Написан, я так понимаю, в поддержку книги "Data Preparation for Machine Learning Data Cleaning, Feature Selection, and Data Transforms in Python" (ссылка ниже, можете ее купить, если нужно). Тем не менее данный материал довольно объемный, состоит из 3-х частей: - Challenge of Data Preparation - Framework for Data Preparation - Data Preparation Techniques и полноценно раскрывает область подготовки данных. Статья: machinelearningmastery.com/framewo…learning Книга: machinelearningmastery.com/data-pr…learning
    Framework for Data Preparation Techniques in Machine Learning - Machine Learning Mastery

    There are a vast number of different types of data preparation techniques that could be used on a predictive modeling project. In some cases, the distribution of the data or the requirements of a machine learning model may suggest the data preparation needed, although this is rarely the case given the complexity and high-dimensionality of the data, the ever-increasing parade of

    Machine Learning Mastery
  • Клуб CDO

    Презентация с конференции HighLoad++ про видеозвонки VK

    1_VK_Видео_архитектура_крупнейшей_видеоплатформы_на_4_Тбит_с_Александр.pdf

    application/pdf
  • Клуб CDO

    Lake House Architecture @ Halodoc: Data Platform 2.0 Довольно подробный обзор архитектуры платформы сбора и обработки данных компании Halodoc. Платформа построена на сервисах AWS, тем не менее архитектурно слои и компоненты, которые описываются в статье, принципиально общие для подобного класса решений и могут быть имплементированы и на решениях других вендоров. blogs.halodoc.io/lake-ho…form-2-0
    Lake House Architecture @ Halodoc: Data Platform 2.0

    At Halodoc, we are always committed to simplifying the healthcare services for our end-users, and as the company grows, we are continuously building and delivering new features. What we have built two years back might not support the amount of data we manage today, to address that we decided to

    Halodoc Blog
  • Клуб CDO

    Data Events

    Расписание и #трансляция бесплатной части HighLoad++ https://highload.ru/foundation/2022/schedule 13.05: 9:30 - 18:40 14.05: 10:00 - 19:00 https://youtu.be/t-4P46qyJcc

    Telegram
  • Клуб CDO

    Federated learning attack surface: taxonomy, cyber defences, challenges, and future directions Делюсь честно нагугленной статьей на тему безопасности методов Federated Learning. Найти было не просто, многое источники просили денег, денег дать им в текущих условиях сложно, поэтому пришлось поискать. Отдельно потом опубликую перевод и основные тезисы.

    Federated learning attack surface taxonomy, cyber.pdf

    application/pdf
  • Реклама

  • Клуб CDO

    Using Data Annotations for Quality Control Purposes

    Data annotations have proven to be highly effective at improving quality control strategies.

    SmartData Collective
  • Клуб CDO

    Google, Meta, and others will have to explain their algorithms under new EU legislation В апреле в UE принят закон (Digital Services Act), согласно которому крупные технологические игроки будут нести еще большую ответственность перед регулятором. В частности: - запрещена таргетированная реклама на основе религии, сексуальной ориентации или этнической принадлежности человека. Несовершеннолетние также не могут быть объектом таргетированной рекламы. - «Dark patterns» — сбивающие с толку или вводящие в заблуждение пользовательские интерфейсы, предназначенные для того, чтобы подтолкнуть пользователей к определенному выбору, — будут запрещены. В ЕС говорят, что, как правило, отменить подписку должно быть так же просто, как подписаться на нее. - Крупные онлайн-платформы, такие как Facebook, должны будут сделать работу своих алгоритмов рекомендаций (используемых для сортировки контента в новостной ленте или предложения телешоу на Netflix) прозрачными для пользователей. Пользователям также должна быть предложена рекомендательная система, «не основанная на профилировании». В случае с Instagram, например, это будет означать хронологическую ленту (как это было введено недавно). - Хостинг-сервисы и онлайн-платформы должны будут четко объяснить, почему они удалили незаконный контент, а также предоставить пользователям возможность обжаловать такие удаления. Однако сам DSA не определяет, какой контент является незаконным, и оставляет это на усмотрение отдельных стран. - Крупнейшие онлайн-платформы должны будут предоставлять ключевые данные исследователям, чтобы «дать больше информации о том, как развиваются онлайн-риски». - Крупные платформы также должны будут внедрить новые стратегии борьбы с дезинформацией во время кризисов. www.theverge.com/2022/4/…ertising
    Google, Meta, and others will have to explain their algorithms under new EU legislation

    The EU’s new legislation is designed to explain the web to users.

    The Verge
  • Клуб CDO

    А всем, кто интересуется рекомендательными системами, рекомендую новый канал моего друга - Саши Петрова: https://t.me/ods_recommender_systems Саша сейчас защищает PhD в Университете Глазго и занимается консалтингом в области RecSys.