Обложка канала

Клуб CDO. Страница 31

1243 @cdo_club

Сообщество профессионалов в области работы с данными и ИИ

  • Клуб CDO

    На этой неделе обсуждаем в голосовом чате тему регулирования технологий ИИ. Собираемся, как обычно, в четверг (11 августа), и ❗️не как обычно❗️ в 17:00 по Москве‼️ Идею дискуссии подкинул 😎Глеб Папышев @glpapv. Глеб является аспирантом Гонконгского университета науки и технологий и автором статей о регулировании новых технологий и их использовании в государственном управлении. Диссертационное исследование Глеба как раз посвящено изучению проблем регулирования ИИ через механизмы мягкого права, операционализации высокоуровневых этических принципов на практике и возможности саморегулирования этих технологий участниками рынка. Попробуем обсудить следующие вопросы: ❓Нужно ли регулировать технологии ИИ на современном этапе их развития? ❓На каких принципах может быть построено регулирования этих технологий? ❓Какие регуляторные документы для ИИ приняты в РФ? Как они влияют на работу специалистов по анализу данных? ❓Как к данному вопросу формально и неформально подходят в различных компаниях и организациях? ❓Возможно ли саморегулирование технологий ИИ силами технологических компаний без вмешательства государственных регуляторов? ❓С другой стороны, возможно ли регулирование технологий ИИ только силами государства? ❓Нужны ли регуляторные документы для регулирования ИИ в различных отраслях экономики или достаточно зонтиковых документов? Подключайтесь, чтобы высказаться по теме и послушать коллег! Ссылка на голосовой чат→
  • Клуб CDO

    Присоединяйтесь в четверг
  • Клуб CDO

    Коллеги из компании oneFactor продолжают радовать нас статьями на тему защищенных совместных вычислений habr.com/ru/comp…g/678794
    Переход от Платформы работы с данными к Платформе конфиденциальных вычислений

    Привет, Хабр! Меня зовут Александр, в компании oneFactor я являюсь руководителем платформенных продуктов, и одна из моих задач — это развитие платформы конфиденциальных вычислений. Именно о них мы и...

    Хабр
  • Реклама

  • Клуб CDO

    Новые рекорды объема языковых моделей - натренирована и опубликована очередная супер большая языковая модель: BigScience Large Open-science Open-access Multilingual Language Model (BLOOM). Поддерживает 43 человеческих языка и 13 машинных. Тренировка заняла 4 месяца и осуществлялась на кластере из 416 A100 80GB GPUs. На текущий момент это самая большая языковая мульти-модальная модель. https://www.infoq.com/news/2022/07/bigscience-bloom-nlp-ai/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=global
    BigScience Releases 176B Parameter AI Language Model BLOOM

    The BigScience research workshop released BigScience Large Open-science Open-access Multilingual Language Model (BLOOM), an autoregressive language model based on the GPT-3 architecture. BLOOM is trained on data from 46 natural languages and 13 programming languages and is the largest publicly available open multilingual model.

    InfoQ
  • Клуб CDO

    Дайджест статей 07/08/2022 Why Blockchain Technology Is the Future of Data Storage dzone.com/article…ata-st-1 What’s the Value of my Data? Today’s Most Critical Yet Hard to Answer Question www.datasciencecentral.com/whats-t…question How to Enable Big Data Best Practices dzone.com/article…ctices-1 15 Data Issues and How to Fix Them www.datasciencecentral.com/15-data…m-part-1 The Value of Real-Time Data Visualization and Interpretation www.datasciencecentral.com/the-val…retation Difference Between Data Mining and Data Warehousing dzone.com/article…rehousin Feature Engineering или стероиды для ML моделей https://habr.com/ru/company/ruvds/blog/680498/
    Why Blockchain Technology Is the Future of Data Storage

    Blockchain is a revolutionary new technology whose features have greatly improved data storage: It has increased storage capacity and improved data security.

    DZone
  • Клуб CDO

    Шумский С.А. Презентация семинара «Мозг и язык: индексация смыслов» Аудиозапись семинара «Мозг и язык: индексация смыслов» Шумский С.А. Мозг и Язык: Гипотеза о строении «органа языка» (можно скачать) social.hse.ru/soc/str…dex.html
  • Клуб CDO

    AWS анонсировали новый продукт для генерации синтетических данных. Такая функция похоже становиться must have для решений по разметке данных, а сам подход обучения моделей на синтетических данных - мейнстримом. www.infoq.com/news/20…agemaker
    AWS Announced Synthetic Data Generation for SageMaker Ground Truth

    AWS announced that users can now create labeled synthetic data with Amazon SageMaker Ground Truth. SageMaker Ground Truth is a data labeling service that makes it simple to label data and allows you the choice to use human annotators through third-party suppliers, Amazon Mechanical Turk, or your own private workforce.

    InfoQ
  • Клуб CDO

    Бывший руководитель администрации президента РФ и член совета директоров “Яндекса” Александр Волошин вместе с основателем Genome Ventures Александром Смбатяном стали совладельцами российского финтех-стартапа Bloomtech. Участники рынка считают, что эта сделка не венчурная и могла быть безденежной. Оба партнера имеют высокий политический вес, что облегчает выход в российский банковский сектор. Bloomtech работает над платформенными решениями для банковского сектора. Согласно информации на сайте компании, она предлагает услуги расчета показателя долговой нагрузки, автоматической верификации данных клиентов, антифрод, графовую аналитику. Bloomtech позиционирует себя как “финтех-платформа для защищенного межбанковского анализа данных о счетах физических лиц с целью снижения риска мошенничества и дефолта”. Согласно данным ЕГРЮЛ, 50% в ООО “Блумтех” владеет Виталий Саттаров, известный также как основатель компании Ubic [разрабатывает решения по анализу больших данных для госструктур и крупных корпораций]. В июле этого года по 25% в “Блумтехе” получили Волошин и Смбатян. Они оба также владеют российским юрлицом Genome Ventures - ООО “Дженом Венчурс”. Компания инвестирует в проекты в области медицины, интернет-торговли и других отраслях. В инвестиционный портфель входят компания по генетическому тестированию Genotek, персонализированная платформа по развитию подростков Profilum. @rusven
  • Клуб CDO

    Немного не по тематике канала, но новость касается компании, о которой я писал в нескольких материалах по теме конфиденциальных вычислений. Поэтому обратил внимание.
  • Клуб CDO

    Небольшое вечернее чтение на философскую тему: можно ли вообще положиться на алгоритмы в принятии решений в своей персональной жизни? Вопрос до сих пор не однозначный. Лично мое мнение, что алгоритмы больших данных, безусловно, хорошо работают на больших выборках и могут быть довольно точными в предсказании статистических показателей этих выборок. Но когда мы переходим на "индивидуальный" уровень и пытаемся предсказать показатели каждого элемента выборки - что-то ломается. Это как в квантовой физике "мы точно знаем время, через которое распадется половина элементов вещества, но абсолютно не знаем, какие конкретно элементы распадаться, а какие нет". В общем, пока еще нужно больше данных. www.theguardian.com/books/2…ecisions
    The big idea: should we be using data to make life’s big decisions?

    Faced with tough choices, people usually fall back on gut instinct or seek the advice of friends. Now, there’s an alternative

    the Guardian
  • Клуб CDO

    Если вы хотите улучшить маркетинговые коммуникации своей компании за счет данных, то вам надо обратить внимание на решение типа CDP (Customer Data Platform) – это система, которая помогает собирать разрозненные данные о клиентском поведении (clickstream, заказы, расход баллов программы лояльности и многие другие) и объединять их в рамках единого клиентского профиля. habr.com/ru/comp…g/679890
    CDP для бизнеса, или Как эффективно подружиться с клиентом

    Всем привет, мы – одна из команд GlowByte, специализируемся на клиентской аналитике и автоматизации маркетинга. В этом материале мы рассмотрим класс продуктов CDP (Customer data platform) –...

    Хабр
  • Клуб CDO

    «Звезда» — оптимальная структура данных при переходе на российский BI

    Бизнес-аналитика — интереснейшее направление работы с данными. С одной стороны пользователи хотят видеть красивые дашборды и простые self-service платформы, а с другой стороны, для организации всего...

    Хабр
  • Клуб CDO

    Путь к “сердцу заказчика”, или Как мы редизайнили дашборды у топового банка России

    Многие компании в РФ сегодня уже далеко не новички в сфере BI. За последние несколько лет технология активно распространилась в нашей стране, дашборды и ad-hoc-визуализации стали активно использовать...

    Хабр
  • Клуб CDO

    Отличная картинка, все что нужно знать и понимать, про решения аналитики данных в современной организации
  • Клуб CDO

    💁‍♂️ HFLabs и Platforma придумали, как безопасно пересекать клиентские базы разных компаний Сделали вместе с компанией Platforma крутейшую штуку: научились пересекать клиентские базы, не передавая персональные данные. Теперь разные компании могут искать общих клиентов, соблюдая законодательство и не боясь утечек. С новой технологией партнеры по экосистеме могут пробовать много интересного: вводить общие программы лояльности, делать кросс-промо, строить подробные модели потребления. Например, банк будет охотнее выдавать кредит, зная, что клиент исправно оплачивает сотовую связь у оператора-партнера. 🕵️‍♂️ Технология основана на сравнении обезличенных хэшей В первом приближении идея проста. Мы сравниваем в разных базах не чистые данные клиентов, а синтетические идентификаторы. Это наборы фиксированной длины из букв и цифр, которые не являются персданными. Сначала стороны обмена в два этапа хэшируют информацию, применяя сессионный ключ-секрет. Ключ доступен только владельцам данных. Затем хэши передают в федеративный хаб, который сравнивает их и находит пересечения в клиентских базах. Модель поддерживает несколько способов хэширования, в том числе закрепленные в ГОСТах. Первый этап хэширования занимает до двух дней. На втором требуется до нескольких часов. 🤯 Одна из важнейших проблем — разный формат данных в разных базах Даже внутри одной крупной компании работает множество IT-систем: CRM, биллинги, кредитные портфели, АБС и много чего еще. Информацию там хранят в разном формате с разным набором полей. Но даже не это самая большая беда. Одни и те же данные в разных системах выглядят по-разному. Самый простой пример: «Наталья» и «Наталия». Для человека очевидно, что эти имена как минимум близки. Но их хэширование даст абсолютно разные идентификаторы. Что уж говорить об адресах, которые все пишут как бог на душу положит. HFLabs традиционно хорош в решении подобных задачах, справились и с этой. Технология сравнения клиентов включает в себя механизм дедупликации, учитывает синонимы, опечатки, взаимозаменяемые слова, устаревшие наименования населенных пунктов и еще много подобных нюансов. 👯‍♂️ Участниками пилотного проекта стали ВТБ и Ростелеком С помощью новой технологии мы объединили базы компаний, содержащие в сумме около 250 млн записей о клиентах. Алгоритмы сравнения применимы как для физических, так и для юридических лиц. Дальше мы намерены масштабировать решение и оформить его в полноценный продукт для бизнеса. Это важный шаг к созданию федеративных экосистем, объединяющих разные компании с равными правами. Подписывайтесь на @hflabs_official
  • Реклама

  • Клуб CDO

    Кажется ребята изобрели велосипед :)
  • Клуб CDO

    Ну тут название статьи говорит само за себя. Основная проблема с качеством данных, которая решается в статье - дрейф данных, когда с течением времени статистические показатели данных меняются (например клиентская база смещается в сторону одного из гендеров, в отличие от распределения, на котором было построен первоначальный набор фичей). https://habr.com/ru/company/ru_mts/blog/677516/
    Промышленный мониторинг качества данных в Feature Store. Предпосылки и реализация

    Привет, Хабр! Меня зовут Алексей Лямзин, я работаю аналитиком в финтех направлении Big Data МТС. Мы с коллегами разрабатываем предиктивные модели на данных крупнейшего телеком-оператора и сегодня я...

    Хабр
  • Клуб CDO

    Я уже рекомендовал тут книгу замечательную - “Делай как в Google. Разработка программного обеспечения” - очень рекомендую всем тут прочитать как минимум первую ее половину. Там очень много про инженерную культуру Google, организацию работы, лучшие практики формиорвания команды, целей и тд. А для тех, кому лень читать 942 страницы всей книги, я вот сделал краткий цитатник на 34 старницы тех моментов, которые особенно понравились мне лично :) может быть кому то покажется полезным. www.litres.ru/titus-v…66336760

    summary_Делай_как_в_Google,_разработка_программного_обеспечения.pdf

    application/pdf