Обложка канала

Алексей Чернобровов. Страница 3

Личный канал Алексея Чернобровова - консультанта в сфере Digital: Data Science, Big Data, BDSM, Digital Transformation, Artificial intelligence – и все вот эти модные слова.:) Анонсы мероприятий, вакансий, зарисовки личной жизни)

  • Алексей Чернобровов

    🤔ТОП-4 рисков embedding’ов в ML Встраиваемые модели широко используются в машинном обучении чтобы перевести необработанные входные данные в низкоразмерный вектор, который фиксирует их семантическое значение и может использоваться для различных последующих моделей. Предварительно обученные встраивания в качестве экстракторов признаков используются для разработки фичей различных типов входных данных (текст, изображение, аудио, видео, мультимодальный) или категориальные признаки с высокой кардинальностью. Главными рисками embedding’ов считаются: • Высокая запутанность - изменение выходных данных восходящей модели встраивания влияет на производительность нижестоящей модели. Полагаясь на выходные данные embedding-модели, следует переобучать нижестоящие модели. • Скрытые петли обратной связи. Предварительно обученные фичи встраивания часто используются как черный ящик. Но знание того, на чем обучалось встраивание необработанных входных данных, очень важно для качества модели и ее интерпретируемости. • Высокие затраты на вывод в реальном времени требует больших затрат (хранение и обслуживание). Это напрямую влияет на рентабельность инвестиций в ML. Важно обеспечить качество во время сбоев в обслуживании встраивания, стоимость обучения и стоимость обслуживания за запрос. • Высокая стоимость отладки - отладка и мониторинг встроенных фичей или основных причин сбоев обходится очень дорого. Поэтому следует отказаться от встроенных фичей, которые не имеют большого значения для модели. medium.com/better-…00cb82e1
    Embeddings: The high-interest credit card of feature engineering

    Embedding models are widely used machine learning models that map a raw input (usually discrete) to a low-dimensional vector. The embedding vector captures the semantic meaning of the raw input data…

    Medium
  • Алексей Чернобровов

    Юмора вам в ленту🦆
  • Алексей Чернобровов

    🗣ReAct от Google AI: синергия рассуждений и действий в языковых моделях Предварительно обученные языковые модели хорошо работают в задачах планирования и выполнения действий в различных интерактивных средах (текстовые игры, веб-навигация, воплощенные задачи, робототехника), позволяя сопоставлять текстовый контекст с действиями. Но эти DL-модели не рассуждают абстрактно о целях высокого уровня и не сохраняют рабочую память в долгосрочной перспективе. Поэтому исследователи Google AI предложили новую общую парадигму, которая сочетает преимущества рассуждений и действий для языковых моделей в задачах рассуждений и принятия решений. Парадигма Reason+Act (ReAct) систематически превосходит парадигмы, основанные только на рассуждениях и действиях, при подсказке более крупных языковых моделей и точной настройке более мелких языковых моделей. Тесная интеграция рассуждений и действий также представляет собой ориентированные на человека траектории решения задач, которые улучшают интерпретируемость, диагностируемость и управляемость. ReAct позволяет языковым моделям генерировать как вербальные следы рассуждений, так и текстовые действия чередующимся образом. Действия приводят к обратной связи наблюдения из внешней среды, а следы рассуждений влияют на внутреннее состояние модели, анализируя контекст и обновляя его полезной информацией для поддержки будущих рассуждений и действий. Проведя ряд экспериментов, направленных на ответы на вопросы с несколькими переходами, проверку фактов и интерактивные задачи принятия решений, исследователи Google AI пришли к выводу, что ReAct обеспечивает высокую производительность с интерпретируемыми трассировками решений. Такая возможность совместного моделирования мыслей, действий и обратной связи с окружающей средой в рамках языковой модели делает ReAct универсальным агентом, способным решать NLP-задачи. ai.googleblog.com/2022/11…ing.html
  • Реклама

  • Алексей Чернобровов

    Сегодня буду делиться своим экспертным мнением на встрече программного комитета по вопросам развития и внедрения искусственного интеллекта Russian Internet Week. Встреча пройдет в неформальной обстановке, где будет возможность подискутировать и получить ответы на интересующие вопросы по темам: • Динамики отрасли искусственного интеллекта в 2022 году и прогнозы на 2023 год • Основные тренды, наблюдаемые в сегменте • Негативные факторы, влияющие на сегмент • Факторы поддержки сегмента Сам RIW пройдёт 12-13 декабря, ключевыми темами станут: аналитика и цифровые тренды, экономика, бизнес, технологии, инновации, трансформация, кадры, digital, mobile, искусственный интеллект, коммуникации, новые медиа, креативные индустрии, госрегулирование и господдержка, и многое другое.
  • Алексей Чернобровов

    Хочу познакомить вас с моими хорошими друзьями – компания LabelMe. На мой взгляд, лучшие поставщики на рынке дата-аннотации для машинного обучения. Могут разметить, что угодно. 🪧 Качественная разметка нужна во всех отраслях, которые заинтересованы в машинном обучении. LabelMe работает с любыми видами аннотации – от классификации до разметки лидарных данных. Часто бывает так что в проекте для качественного обучения моделей не хватает данных и открытые датасэта не спасают, в этом случае я с удовольствием обращаюсь в LabelMe. Работаю с ними, потому что у них качественный и вдумчивый подход к разметке. 📍Перед выполнением любого проекта, команда LabelMe подготавливает бесплатный тестовый датасет. Это позволяет на стадии согласования определить пайплайн работы, сложность и реальные сроки выполнения заказа. В компании налажена своя система обучения аннотаторов, выстроены связи со специалистами разных отраслей. Например, для разметки медицинских данных привлекаются практикующие врачи. Готовые данные проходят несколько уровней валидации качества. Если вам нужна хорошая разметка, искренне рекомендую – в LabelMe любят свою работу и делают ее отлично. И я договорился с ребятами, что они вам сделают скидку 5% на первый заказ от меня по промокоду 👉 Chernobrovov5. Кстати, у них и без скидки очень адекватные цены! 😊
  • Алексей Чернобровов

    6. TSFresh https://github.com/blue-yonder/tsfresh Этот Python-пакет, который автоматизирует процесс извлечения признаков из временных рядов. Он основан на идее, что информацию во временном ряду можно разложить на набор значимых характеристик, называемых признаками. Tsfresh берет на себя утомительную задачу ручного извлечения этих признаков и предоставляет инструменты для автоматического выбора и классификации признаков. Пакет предназначен для работы с датафреймами pandas и предоставляет широкий спектр функций для работы с данными временных рядов, в т.ч. автоматическое извлечение признаков из временных рядов, автоматический выбор фичей, разложение временных рядов, снижение размерности, обнаружение выбросов, поддержка нескольких форматов временных рядов и поддержка пропущенных значений.
    GitHub - blue-yonder/tsfresh: Automatic extraction of relevant features from time series:

    Automatic extraction of relevant features from time series: - GitHub - blue-yonder/tsfresh: Automatic extraction of relevant features from time series:

    GitHub
  • Алексей Чернобровов

    Совсем скоро 17.11 - 18.11 в Варшаве состоится очередной Data Science Summit 💻. Одна из крупнейших конференций в Европе по DS. Я там буду выступать с докладом "Different approaches to orchestrating machine learning models that work on the same task". 📋 В этом году программа состоит из 16 тематических треков и более 200 спикеров из ведущих компаний таких как NVIDIA, Microsoft, Google. В каждом треке можно найти темы для любого уровня опыта - от трендов до глубоких погружений. Cамые интересные треки: ▪️Бизнес-аналитика и визуализация данных ▪️Большие данные / Хранилища данных ▪️MLOps / DataOps / Deployment ▪️DS в медицине ▪️Квантовые вычисления на Python 📩 Регистрация на официальном сайте
  • Алексей Чернобровов

    4. Sktime https://github.com/sktime/sktime Это расширение для scikit-learn API, которое включает набор инструментов для обработки, визуализации и анализа данных временных рядов. Sktime предоставляет методы эффективного решения проблем, связанных с регрессией временных рядов, прогнозированием и классификацией. Библиотека содержит специализированные алгоритмы машинного обучения, а также преобразования временных рядов, включая конвейерную обработку, сборку, настройку и сокращение, позволяя пользователям применять алгоритм решения одной задачи к другой. Sktime также предоставляет интерфейсы для связанных библиотек, например, scikit-learn, statsmodels, tsfresh, PyOD и пр.
    GitHub - sktime/sktime: A unified framework for machine learning with time series

    A unified framework for machine learning with time series - GitHub - sktime/sktime: A unified framework for machine learning with time series

    GitHub
  • Алексей Чернобровов

    1.MERLION https://github.com/salesforce/Merlion Эта сквозная среда машинного обучения включает загрузку и преобразование данных, построение и обучение ML-моделей, постобработку выходных данных модели и оценку ее производительности. Библиотека поддерживает различные задачи обучения временных рядов, включая прогнозирование, обнаружение аномалий и обнаружение точек изменения одномерных и многомерных временных рядов. Методы библиотеки поддерживают как классические статистические методы и ансамбли деревьев, так и подходы к глубокому обучению, позволяя пользователям настраивать ML-модели по своему усмотрению. Кроме того, Merlion поддерживает автоматическое машинное обучение (AutoML) для автоматической настройки гиперпараметров и выбора модели. Благодаря простым, но эффективным правилам постобработки для детекторов аномалий, повышается их интерпретируемость, а также снижается количество ложных срабатываний. Простые в использовании ансамбли объединяют выходные данные нескольких моделей для повышения надежности, а гибкие конвейеры оценки имитируют реальное развертывание и повторное обучение модели в рабочей среде, позволяя оценивать ее производительность при прогнозировании и обнаружении аномалий. Наконец, еще одним плюсом Merlion является встроенная поддержка визуализации предсказаний модели.
    GitHub - salesforce/Merlion: Merlion: A Machine Learning Framework for Time Series Intelligence

    Merlion: A Machine Learning Framework for Time Series Intelligence - GitHub - salesforce/Merlion: Merlion: A Machine Learning Framework for Time Series Intelligence

    GitHub
  • Алексей Чернобровов

    🎲ТОП-7 Python-библиотек для анализа временных рядов Анализ временных рядов - одна из самых популярных прикладных областей машинного обучения. Такие задачи встречается практически во всех областях от трейдинга до прогноза спроса. На сегодняшний день, существует большое разнообразие Python-библиотек для решения таких задач. Решил собрать все самые интересные в одном месте. Буду каждый день постить по библиотеке! :)
  • Алексей Чернобровов

    💠10 ноября в Иннополисе состоится Innopolis meetup: Data Science и ML! Я буду рассказывать о том, что делать, когда модели машинного обучения начинают влиять друг на друга. На митапе будут еще 2 классных спикера: Михаил Степнов (МТС) и мой старый знакомый Андрей Кузнецов (Ok.ru). Доклады будут полезны тем, что хочет безболезненно внедрить очень много ML, перенастроить процессы сбора данных. Темы больше подойдут middle data scientist'ам и выше. Митап будет в офлайне, поэтому это отличная возможность послушать интересные темы и пообщаться со спикерами очно. Поэтому если вы в Казани или в Поволжье не поленитесь приехать тусоваться на митап. 🎉 🕡 Когда: 10 ноября в 18:30 (московское время) 🗺 Где: Иннополис, Технопарк им. Лобачевского, коворкинг 🆓 Митап бесплатный, но нужно пройти регистрацию.
  • Алексей Чернобровов

    Дельфин 660 Все изображения созданы искусственным интеллектом Midjourney @aitspace
  • Алексей Чернобровов

    🗣AudioLM: подход языкового моделирования к генерации звука от Google AI Создание реалистичного звука требует моделирования информации, представленной в разных масштабах. Подобно тому, как музыка строит сложные музыкальные фразы из отдельных нот, речь объединяет локальные во времени структуры, такие как фонемы или слоги, в слова и предложения. Создание хорошо структурированных и связных звуковых последовательностей во всех этих масштабах является проблемой, которая была решена путем объединения аудио с транскрипцией, направляющей процесс генерации, включая текстовые расшифровки для синтеза речи или MIDI-представления для фортепиано. Однако, этот подход не работает при попытке смоделировать нетранскрибированные аспекты звука, такие как характеристики динамиков, необходимые для помощи людям с нарушениями речи, или стилистические компоненты игры на фортепиано. Поэтому исследователи Google AI предложили новую структуру для генерации аудио, которая учится генерировать реалистичную речь и фортепианную музыку, слушая только аудио. Звук, созданный AudioLM, демонстрирует долгосрочную согласованность (синтаксис речи, мелодию музыки) и высокую точность, превосходя предыдущие системы и расширяя границы генерации звука с помощью приложений для синтеза речи или компьютерной музыки. Также была разработана модель для идентификации синтетического звука, генерируемого AudioLM. При этом пришлось решить некоторые проблемы, связанные с тем, что скорость передачи данных для аудио значительно выше, что приводит к гораздо более длинным последовательностям. Если письменное предложение может быть представлено несколькими десятками символов, его аудиосигнал обычно содержит сотни тысяч значений. Во-вторых, между текстом и звуком существует отношение «один ко многим». Это означает, что одно и то же предложение может быть воспроизведено разными говорящими с разным стилем речи, эмоциональным наполнением и условиями записи. Чтобы преодолеть обе проблемы, AudioLM использует два типа аудиотокенов: семантические токены из w2v-BERT, самоконтролируемой аудиомодели, которые охватывают локальные зависимости (фонетику речи, мелодию в музыке) и глобальную долгосрочную структуру (синтаксис языка и семантическое содержание в речи, гармонию и ритм в музыке). Сам аудиосигнал сильно понижается. для моделирования длинных последовательностей. Но звук, восстановленный из этих токенов, имеет низкую точность воспроизведения. Чтобы обойти это ограничение, в дополнение к семантическим токенам используются акустические, созданные нейрокодеком SoundStream, которые захватывают детали звуковой волны (характеристики динамика или условия записи) и обеспечивают высококачественный синтез. Обучение системы генерированию как семантических, так и акустических токенов одновременно приводит к высокому качеству звука и долговременной согласованности. ai.googleblog.com/2022/10…-to.html
    AudioLM: a Language Modeling Approach to Audio Generation

    Posted by Zalán Borsos, Research Software Engineer, and Neil Zeghidour, Research Scientist, Google Research Generating realistic audio re...

    Google AI Blog
  • Алексей Чернобровов

    Всем привет!🔥 Как уже писал ранее, я буду выступать на Кипре на Linq Conference. По дороге я посещу несколько культовых точек для русского IT в последнее время, поэтому буду рад встретиться с теми, кто сейчас там. 1) Полечу через Армению 🇦🇲 и буду там с 7 по 11 октября. 2) Сам Кипр🇨🇾 будет с 11 по 18 октября. И если сейчас там есть те, кого я давно не видел, идеальным местом встречи будет на конференции. Но также, можно будет договориться и в другие дни в Пафосе или Ларнаке. 3) Возвращаться буду через Стамбул🇹🇷 с 19 по 23 октября. Знаю, что там много моих друзей и предлагаю, тоже устроить встречу! Пошел проверять директ🤔
  • Алексей Чернобровов

    Нейросеть Stable Diffusion теперь может рисовать пышногрудых женщин и мускулистых парней. Один из пользователей нейросети модифицировал и обучил её рисовать девушек с «анимэшными» лицами по текстовому запросу. @aitspace
  • Реклама

  • Алексей Чернобровов

    🍁TOP-10 DS-events all over the world • Oct 4-5 • Modern DataFest • Virtual https://www.datacated.com/moderndatafest • Oct 4-6 • NLP Summit 2022 • Virtual https://www.nlpsummit.org/ • Oct 5-6 • Deep Learning World • Berlin, Germany https://deeplearningworld.de/ • Oct 5-6 • Marketing Analytics Summit • Berlin, Germany https://marketinganalyticssummit.de/ • Oct 6-7 • Big Data & AI Toronto • Toronto, ON, Canada https://www.bigdata-toronto.com/ • Oct 10-13 • Chief Data & Analytics Officers, Fall • Boston, MA, USA https://cdao-fall.coriniumintelligence.com/ Oct 13-14 • Linq Conference – use the promocode ChernobrovovxLinq to 5% discount of ticket price https://linqconf.com • Oct 17-21 • DeepLearn 2022 Autumn: 7th International School on Deep Learning • Luleå, Sweden https://irdta.eu/deeplearn/2022au/ • Oct 25-26 • IMPACT 2022: The Data Observability Summit • London, UK, New York, NY, Bay Area, CA + Virtual https://impactdatasummit.com/2022 • Oct 27-28 • The Data Science Conference • Chicago, IL, USA https://www.thedatascienceconference.com/home
    Modern DataFest

    Datacated
  • Алексей Чернобровов

    📌13-14 октября на Кипре состоится классная конференция Linq Conference Будут выступать спикеры из Google, Amazon, Nvidia и других ведущих IT-компаний. 📊На конференции будут 5 трэков: 1. ML/AI 2. PR 3. GameDev 4. Metaverse 5. Relocate А ещё множество развлечений, неформального общения и пляжных тусовок. 🏝 Я буду выступать в секции ML с докладом "Как оркестрировать несколько моделей машинного обучения, которые по-разному воздействуют на бизнес". Официальный сайт конференции https://linqconf.com 🎁А также у меня есть промокод "ChernobrovovxLinq", он дает скидку 5% билет!
  • Алексей Чернобровов

    Заменит ли ИИ человека?👨‍💻 Много разговоров ведётся вокруг будущего ИИ, каждый раз открывая новые факты в обучении и отслеживая его поведение - меняются и взгляды. Но короткий и правильный ответ: Конечно, нет! Я выделил 3 основные причины, почему это не случится в ближайшее время: ◾️ Невозможность интерпретировать ИИ; ◾️ Отсутствие ответственности (юридическая, социальная и уголовная); ◾️ Отсутствие типовых паттернов. Более подробно, можно ознакомиться в статье "Когда ИИ заменит людей и заменит ли?" на моем сайте 👇 chernobrovov.ru/article…-li.html