Обложка канала

Клуб CDO. Страница 43

1243 @cdo_club

Сообщество профессионалов в области работы с данными и ИИ

  • Клуб CDO

    Блез Агуэра-и-Аркас, руководитель группы Google AI в Сиэттле, ставит вопрос ребром: Do large language models understand us? Вопрос лишь на первый взгляд кажется абсурдным, с однозначным ответом, но по ходу чтения его эссе начинаешь все больше задумываться. Большие языковые модели воплощают идею философского зомби: они работают на статистике и разговаривают [якобы] без понимания. Но этот вопрос не разрешим в каком-либо строгом смысле — Блез показывает, что LLM постоянно моделируют собеседника, ведя нечто вроде внутреннего диалога, генерируя разные ответы и выбирая лучший. То есть у модели возникает подобие того, что психологи называют «теорией разума», и не ясно, как отличить «настоящее» понимание от «фальшивого». Рассуждения Блеза заходят на фоне недавних прорывов в машинном обучении, явленных нам в виде DALL-E 2 от OpenAI, создающей картинки по текстовому описанию, и PaLM от Google, умеющей схватывать смысл и контекст беседы. И на контрасте с недавним эссе Гари Маркуса, CEO компании Robust.AI, Deep Learning Is Hitting a Wall, где он громит любые прорывы, настаивая, что DL не имеет ни малейшего отношения к интеллекту и пониманию. Ян Лекун и другие усмехаются в ответ, приводят Маркусу впечатляющие примеры из DALL-E 2 и PaLM, а тот огрызается в твиттере, называя их сherry picking, и конца у этого сюжета нет. При всей давней симпатии к Маркусу должен признать, его текст уступает по глубине тексту Агуэра-и-Аркаса. И немного о трендах. PaLM вмещает 540 млрд параметров, что в три раза больше знаменитой GPT-3, за счет чего результаты в обработке языка резко улучшились. В Китае, используя экзафлопсный суперкомпьютер, создают систему BaGuaLu для обучения модели с 14,5 трлн параметров. Как пишут разработчики, BaGuaLu потенциально «имеет возможность обучать модели с 174 трлн параметров, что превосходит количество синапсов в человеческом мозге».
    Do large language models understand us?

    LLMs have a great deal to teach us about the nature of language, understanding, intelligence, sociality, and personhood.

    Medium
  • Клуб CDO

    Кстати очень интересная дискуссия
  • Клуб CDO

    Data Fest 3.0 - Reliable ML - Call for presentations В этом году - 21 мая 2022 г. - состоится Data Fest 3.0 - крупнейшая конференция крупнейшего русскоязычного сообщества Open Data Science в области анализа данных. Конференция будет онлайн, о деталях проведения скоро будет известно. А сейчас хотелось бы объявить сбор заявок на доклады по теме Reliable ML. О том, что такое Reliable ML можно почитать тут. Форма для заявок вот тут. Будем рады, если сможете рассказать об интересных теоретических аспектах, или о кейсах применения в бизнесе по следующим темам: - Планирование исследований и развития продукта – #planning - Причинно-следственный анализ в машинном обучении – #causal_inference - АБ-тестирование – #ab_testing - Управление рисками инвестиционных инициатив – #investment_process - Интерпретация моделей – #interpretable_ml - Выбор технических и бизнес-метрик для оценки качества моделей - #metrics
  • Реклама

  • Клуб CDO

    SberDevices представила многоязычную версию нейросети GPT-3: модель под названием mGPT может генерировать тексты на 61 языке мира, включая языки народов России и стран СНГ. mGPT — это первая в мире генеративная модель, которая поддерживает такое большое число языков. Она доступна в двух версиях: базовая версия с 1,3 млрд параметров — опубликована в открытом доступе в облачном хранилище СберДиск; расширенная версия с 13 млрд параметров — скоро станет доступна на платформе машинного обучения ML Space от SberCloud. Модель mGPT может как генерировать текст, так и решать различные задачи в области обработки естественного языка путём дообучения или в составе ансамблей моделей. Модель показывает выдающиеся результаты на многих задачах few-shot и zero-shot learning: в этой области машинного обучения не требуется отдельно доучивать модель, достаточно сформулировать задачу текстом и привести несколько примеров, после чего mGPT научится выполнять новую задачу. Так автоматизированную систему можно научить отвечать на вопросы, определять эмоциональную окраску текста, извлекать из текста имена, фамилии, названия компаний. Модель может также использоваться как компонент различных речевых технологий, например для улучшения качества распознавания речи, генерации сценариев диалоговых систем. PS аккуратно, вес модели 2,8Гб https://files.sberdisk.ru/s/NzeBqYE84TAQDiS
    Файл из облака SberDisk

    SberDisk.ru - безопасное облако для ваших файлов

    СберДиск
  • Клуб CDO

    новый аналитический материал вышел - “Прорывные инновации: человек 2.0” В издании представлены результаты совместного исследования Института статистических исследований и экономики знаний (ИСИЭЗ) НИУ ВШЭ и Управления исследований и инноваций Сбербанка. Рассматриваются ключевые глобальные тренды, определяющие траектории развития важнейших компонентов человеческого потенциала, и технологии, направленные на совершенствование физических и умственных способностей человека. Доклад подготовлен в рамках гранта, предоставленного Министерством науки и высшего образования Российской Федерации (№ соглашения о предоставлении гранта: 075-15-2020-928)

    Прорывные_инновации_Сбер_U_финал_на_печать.pdf

    application/pdf
  • Клуб CDO

    📚 26 мая — старт курса «Клиентские данные в энтерпрайзе: от проектирования MDM-системы до Data Governance и аналитики» 26–28 мая HFLabs проведет уже четвертый поток офлайн-курса. Мы изучили отзывы и доработали программу, чтобы новый набор был полезнее. А еще упаковали материал в три полных дня вместо пяти половинчатых. 👨‍🎓 Для кого этот курс Курс полезен всем, кто работает или будет работать с данными в крупной компании: банке, страховой, ритейле или телекоме. Специальность роли не играет — знания пригодятся аналитикам, архитекторам, тестировщикам, инженерам по данным и представителям бизнес-подразделений. 🧠 Что узнают студенты Мы покажем принципы работы с клиентскими данными: как их правильно хранить, обновлять, стандартизировать, сливать дубликаты, передавать в другие системы и анализировать. Даем мощную базу — все, что узнали за 10 лет работы с данными в крупном бизнесе. ✔️ Где пригодятся знания с курса Мы рассказываем о работе с данными на примере MDM-систем — Master Data Management. Но эти знания пригодятся, чтобы встроить любую систему в архитектуру компании. Неважно, с какими инструментами студенты работают или будут работать. ✏️ Как записаться Купить билет можно на странице курса. Там же — подробная программа, рассказ о преподавателях, примеры лекций и отзывы студентов. Осталось 13 мест. https://bit.ly/3OpdwLa
  • Клуб CDO

    Data Fusion - вот еще один новый термин появился в области работы с данными, а коллеги из ВТБ и Сколкого даже успели выдать награды за выдающиеся достижения в этой области! www.cnews.ru/news/to…i_premii
    CNews, ВТБ и «Сколково» назвали победителей премии Data Fusion Awards

    В Москве объявили лауреатов первой общероссийской кросс-отраслевой премии в области технологий больших данных...

    CNews.ru
  • Клуб CDO

    Data Mesh Delivering Data-Driven Value at Scale Zhamak Dehghani полная версия

    9781492092322.pdf

    application/pdf
  • Клуб CDO

    Дайджест статей 16/04/2022 Build Data Factories, Not Data Warehouses thenewstack.io/build-d…rehouses Могут ли российские дашборды стать альтернативой Qlik/Tableau/PowerBI? https://habr.com/ru/post/660321/?utm_source=habrahabr&utm_medium=rss&utm_campaign=660321 Что такое MLOps? Операции машинного обучения на пальцах https://habr.com/ru/post/660313/?utm_source=habrahabr&utm_medium=rss&utm_campaign=660313 Successful AI Requires Data Governance dzone.com/article…vernance Benefits of Data Governance and Compliance www.datasciencecentral.com/benefit…mpliance
    Build Data Factories, Not Data Warehouses

    We don’t store data in warehouses; we operate data factories without quality controls.

    The New Stack
  • Клуб CDO

    Уверен, многие в этом канале управляют не только данными, но и людьми, поэтому хочу дать рекомендацию по чтению на выходные. Отличное саммари лучших практик и самых базовых вещей, собранных в одной книге. www.litres.ru/v-zima/…t-onlayn
    Читать онлайн «Инструменты руководителя. Понимай людей, управляй людьми», Владимир Зима – ЛитРес

    Читать онлайн книгу «Инструменты руководителя. Понимай людей, управляй людьми» автора Владимира Зимы полностью, на сайте или через приложение ЛитРес: Читай и Слушай. Книга правообладателя Питер.

    www.litres.ru
  • Клуб CDO

    Совместные конфиденциальные вычисления на пальцах

    В этой небольшой заметке я хочу затронуть тему совместных конфиденциальных вычислений и попробовать кратко изложить суть этих подходов и развеять несколько неоднозначностей, сложившихся в трактовке...

    Хабр
  • Клуб CDO

    просто оставлю это тут. не про данные, но кажется что довольно объективный взгляд на перспективы, напрямую затрагивающие и нашу data тематику thebell.io/kak-ros…sanktsiy
  • Клуб CDO

    о, путем перевода китайских научных статей на английский, вышел на еще одну платформы для Federated Learning. Кстати, разработчик - Tencent. В копилочку 🙂 https://angelml.ai/ вот тут можно почитать краткое саммари: blog.actorsfit.com/a…/a
  • Клуб CDO

    Всех причастных поздравляю с Днем космонавтики! Как имеющий диплом аэрокосмичекого увиверситета, имею право отпраздновать :)
  • Клуб CDO

    Отъезд ИТ-талантов из РФ сформировал острую нехватку кадров по машинному обучению - исследование Headhunter По данным HH, конкуренция на вакансии, связанные с работой в ИИ, очень низкая: менее 2-х человек на место. Для сравнения: в целом в IT-сфере средний показатель — 3 человека на место. Это свидетельствует о дефиците ИИ-специалистов на рынке труда, отмечают аналитики hh: с января по март 2022 года были созданы или обновлены только 16 тыс. резюме профильных специалистов, тогда как только в марте по специальностям IT было размещено более 200 тыс. резюме. Ситуацию на рынке ИИ в России осложнили санкции: 1. разработчикам ограничивают доступ к международным хранилищам данных, на которых обучаются нейросети, возникает дефицит необходимых вычислительных мощностей из-за ухода с рынка операторов облачных сервисов. 2. Многие проекты с использованием ИИ как в госсекторе, так и в бизнесе поставлены на паузу. https://t.me/blockchainRF/5851 3. Кадровый голод в отрасли усугубляет и стремление части IT-специалистов покинуть страну.
    Нейросетям требуются мозги

    Компании не могут найти специалистов в области машинного обучения

    www.kommersant.ru
  • Реклама

  • Клуб CDO

    Не могу пройти мимо. В целом, конечно, мы можем говорить что за несколько лет восполним и кадры и вернёмся по развитию ИИ в состояние 2021 года, но…
  • Клуб CDO

    Дайджест статей 09/04/22 Продолжаем героически просматривать новостные ленты и собирать ссылки, относящиеся к управлению данными. Сегодня подборка как бизнес-материала, так и несколько ссылок про технологии хранения и обработки данных. Монетизация данных. Зачем Большой Брат следит за нами? https://habr.com/ru/post/659527/?utm_source=habrahabr&utm_medium=rss&utm_campaign=659527 Причина и следствие https://habr.com/ru/post/657747/?utm_source=habrahabr&utm_medium=rss&utm_campaign=657747 Как построить систему аналитики на open-source — туториал по cube.js https://habr.com/ru/post/658581/ Data Observability: Cracking the Code www.datasciencecentral.com/data-ob…the-code Building a Data Products-centric Business Model www.datasciencecentral.com/datastr…i-iot-ml Hudi, Iceberg и Delta Lake: сравнение табличных форматов для озера данных https://habr.com/ru/post/658563/?utm_source=habrahabr&utm_medium=rss&utm_campaign=658563 The Lakehouse: An Uplift of Data Warehouse Architecture dzone.com/article…itecture
    Монетизация данных. Зачем Большой Брат следит за нами?

    2021-й год стал первым годом, когда крупные компании начали понимать на практике, зачем же они следят за пользователями. До этого бигдата была инструментом поиска вещей, которые можно было сделать...

    Хабр
  • Клуб CDO

    Ребята, которые сделали титаническую работу - прочитали огромный DMBOOK и сделали конспект основных идей (писал об этом ранее), продолжают разивать проект Data Literacy Project и подготовили отчет Data Literacy: The Upskilling Evolution («Дата-грамотность: Повышение квалификации. Эволюция»)*. Исследование основано на базе экспертных интервью и опросов более чем 1200 руководителей высшего звена и 6000 сотрудников по всему миру. Результаты исследования оказались практически идентичными во всех регионах. Главный вывод: быстрый рост использования данных изменил методы работы и заставил компании повысить требования к компетенциям сотрудников. Компании все больше переходят от пассивного потребления данных к активной аналитике Active Intelligence, когда они могут оперативно принимать решения на основе полученных данных. Отчет, в свою очередь, прогнозирует, как эти изменения повлияют на требования к навыкам и профессиональные возможности. Ознакомиться с исследованием можно по ссылке: https://dataliteracy.ru/be-data-literate-2030
    Исследование: грамотность в работе с данными

    Навык Data Literacy станет наиболее востребованным к 2030 году

    dataliteracy.ru