telegram Telegram Web

Дата канальи — про «специалистов» в данных / ML / AI

Please open Telegram to view this post

2.5K viewsedited 16:00

Дата канальи — про «специалистов» в данных / ML / AI

Сегодня рассказывал студентам что feature engineering еще актуален -- в том числе, для моделей в высоконагруженных сервисах, например, DSP-платформах в рекламе. Потому как расчет фичей можно реализовать на Go и останется только применить бинарник модели к уже насчитанным фичам.

И тут я говорю фразу -- ну нет же на Go реализации сложных сеток (хотя пару лет назад я вынашивал мысль сделать сделать такую ML-библиотеку). С этими словами я полез гуглить и оказалось что я слоупок -- уже 2 месяца как в гите есть реализация трансформеров на Golang.

Невероятно как быстро устаревают знания об области в которой годами работаешь 😱

2.3K viewsedited 18:10

Дата канальи — про «специалистов» в данных / ML / AI

Когда думаешь что видел самые извращенные графики и самые вырвиглазные EDA, судьба преподносит шедевры.

После них графики с тремя осями -- образец четкости и понятности в донесении мыслей 😅😂

2.0K views20:25

Дата канальи — про «специалистов» в данных / ML / AI

«LLM уравняли всех — и джунов и тимлидов» — сказал один мой приятель.

Если верить цитатам в интернете, то еще «God made men, but Samuel Colt made them equal»

Сначала вообще про «уравнивание», а потом и до LLM дойдем.

Многие слышали про проект «осознанная меркантильность», про советы про накрутку опыта, про работу одновременно на 2-3 работах и прочее.

Многие менеджеры аргументируют в духе «а если все так начнут делать кто работать будет?».

Так вот, мне, как менеджеру, ребята с 2-3 работами более чем нравятся:

◦ Насмотренность и число технологий, с которыми они знакомы, у них всяко выше чем у сотрудника с 10+ лет на одном месте
◦ Знаний и навыков тоже — они постоянно проходят — ловят тренд на актуальные запросы рынка, оперативно учат то, чего не хватает
◦ Коммуникативно они тоже как правило сильные
◦ Работать с ними можно как с подрядчиком — на вход описанная задача, на выход — результат
◦ Расставаться в случае косяков с таким сотрудников не жалко и не сложно (у него еще 2 работы есть)

А теперь вернемся в начало — что рынку могут предложить тим. лиды, которые по 5 лет делают одно и то же? Блевотное «ставил задачи и контролировал их выполнение» из резюмех? Лояльность компании ?
Знание, какой цвет в презентации у шефа любимый (и то, если кукбуки позволяют)?

Если вы тимлид — остановитесь и задумайтесь, какие востребованные рынком навыки и знания (а не карьерный трек и опыт в годах) вас сейчас дифференцируют от мидла или синьора?
Умение декомпозировать задачи и планировать проект? Но каждый кто хоть раз сам ездил в отпуск и успешно из него вернулся — готовый руководитель проекта (точно так же оценивал риски, планировал бюджет, справлялся с нежданчиками, находил trade-off со стейкхолдерами)

Будет здорово, если поделитесь в комментариях (а если пост хотя бы 50 лайков наберет — напишу свою версию про себя).

Если вы из бизнеса — чего, кроме навыков, вы хотите от соискателя? Почему не подойдет соискатель без опыта, но с навыками и знаниями?

Так что мб и не LLM всех уравнял, а рынок, которые очень быстро развивается и меняет фокусы? Хотя с момента появления статьи про внимание 8 лет почти прошло — кто мешал заботать?

В штатах малый бизнес массово переключается на API к LLM и не нанимает экспертов со степенью чтобы полгода разрабатывать модель для узкой задачи.
Прототипы тоже собираются за вечер.

Есть и обратная сторона — шапкозакидательные поверхностные ребята, которые впаривают бизнесу работающие прототипы, а те потом топают ножкой со словами «да чего тут делать» и не понимают чем пром. решение отличается от прототипа.

Небольшой лайфхак, спросите ребят, которые лихо прикручивают прототип на базе API какой-н LLM:

◦ Насколько guardrails уменьшит latency? Хотя бы на 20% будет?
◦ На сколько % SFT снижает галлюцинации по сравнению с QLORA?
◦ В чем преимущества Groundedness над Faithfullness?

Все они, конечно же, провокационные и подталкивающие к ошибке, но срезать верхогляда — бесценно.

PS. Буду рад узнать вашу версию кого стоит нанять — джуна или тимлида (предполагается одинаковый функционал) при равенстве навыков, релевантных бизнесу в моменте (LLM например).

я в отпуске, пообщаться в комментах — велком!

2.4K viewsedited 15:21

Дата канальи — про «специалистов» в данных / ML / AI

вдогонку к прошлому посту -- как я вижу деление на грейды (на примере модели оттока):

Junior — строит модель оттока и замеряет roc_auc

Middle — убеждается что отток по месяцам стабилен, замеряет lift, калибрует на вероятности

Senior — Don’t Predict the Churn , prevent it! — строит модель, которая предлагает какую-то опцию (скидку например) только тем, кто а) хочет уйти б) на опцию среагирует и в) финансовый итог такой операции будет положительным — а-ля аплифт моделирование

Team leader — отправляет аналитика и DS разбирать обратную связь по продукту, находит причины оттока, на пальцах прикидывает сколько денег можно сэкономить если эти причины устранить — идет бодаться с продактом чтобы это сделать

CDS — все массовые задачи платформизировал, а по остальным погружен во все 4 уровня (заодно и ревью устроить может)

а следующим попробую погадать что рынку могут предложить CDSы

2.7K views10:07

Дата канальи — про «специалистов» в данных / ML / AI

Еще в копилку тревожности синьоров и манагеров -- Revenge of the junior developer

Классческий естественный отбор -- выживает самый адаптивный

Sourcegraph

Revenge of the junior developer | Sourcegraph Blog

The latest installment from Steve Yegge on viiiiibe coding and what that means for developer jobs.

2.7K views15:04

Дата канальи — про «специалистов» в данных / ML / AI

Все руки не доберутся до поста , все силы на рыбалку уходят

2.3K views13:37

Дата канальи — про «специалистов» в данных / ML / AI

нормально у них там электричество отключили -- аж дедлайн на 4 дня продлили (был 12го)

1.6K views02:54

Дата канальи — про «специалистов» в данных / ML / AI

Обещанное имхо про то, что же дифференцирует мидлов / синьоров / лидов и далее до CEO.

По традиции с кейса, но раз уж отпуск вчера закончился — вот вам отпускная история.

Однажды в отпуске (не в этот раз, но в этом же месте) соблазнились мы с семьей экскурсией - поплавать с огромными морскими дьяволами (они же манты, но не те что в хинкальной). Взяли катер, капитана, капитан свою подружку, и поплыли.
Манты они не то чтобы деревья — они не растут в одном месте, они плавают по океану, так что мы доверились капитану, не вникая в географию, и минут 40 плыли от нашего острова, как потом выяснилось, примерно сюда.

Не обнаружив на мелководье дьяволов, пошли в сторону открытого моря, заметили мантов, здесь кэп с подругой и мной высадились в новом месте и поплыли догонять. Предусмотрительно (хе-хе) не взяв ласты и трубку (хорошо хоть очки были), я сильно отстал. Погода начала портиться, и кэп недолго думая свернул удочки, залез с подругой на катер и испарился в одном из равнозначных (посреди моря-то) направлений. Единственная оказия — я-то так и остался в воде 😂🙈. Пошел дождик, ветер поднимает полуметровые волны (а мб и больше — кто их измерял), они накрывают с головой, дальше пары метров вокруг не видно ничего кроме воды, а я стремительно понимаю что не зря возраст Христа считают опасным.

Как вы знаете, фамилия моя не Фелпс, да даже если бы и так — плыть-то в какую сторону? Да и плыть против волн такое — только устанешь быстрее и все, а здесь и на плаву держаться уже не просто.

Через какое-то время тучи сдуло, дождик прошел, море стало поспокойнее, начало проглядывать солнце.
А еще оказалось что туристы с соседнего острова Расду тоже соблазнились плаваньем с мантами и их катер остановился достаточно близко чтобы я к нему доплыл пока они выгружались (человек 10) и ныряли. Характерна реакция их капитана — он нисколько не удивился моему появлению (видимо, белые для них на одно лицо).

Мораль история простая — какие бы у тебя не были харды, и в жизни и в корпорации ты зависишь от других людей, причем жизненно зависишь, и не всегда это очевидно. И, как минимум, чтобы харды применить — надо знать куда плыть.

И дифференциатором грейдов выступают в первую очередь твои социальные навыки и социальный капитал — ни разу не видел чтобы CEO нанимали по объявлению (разве что зиц-председателя Фунта).

Нередко вижу ситуацию когда лидом в компании работает не крутой DS, а тот кто там работает давно.На первый взгляд кажется что это не очень меритократично. Однако, если речь о запуске новой инициативы и выделения ресурсов под нее — у кого будет кредит доверия? Разве у варяга? Разве что у варяга с репутацией и нетворком — и то не факт что оставят без присмотра кого-то «своего», пусть это и не будет формализовано.

Это не значит что не надо растить свою компетенцию — но стоит рассматривать свою экспертность и ее развитие в тч как инструмент социальный. Нужно осваивать навыки речи -- письменной, устной, невербальной. Уметь делать так, чтобы тебя понимали и не понимали когда ты этого хочешь. Но это все -- все еще имхо 😄

1.6K views14:59

Дата канальи — про «специалистов» в данных / ML / AI

Forwarded from Трупная выборка

1.5K views05:26

Дата канальи — про «специалистов» в данных / ML / AI

А что же харды? Только чтобы надувать щеки и блистать «экспертностью»?

Искренне убежден, что нормально заботать харды можно исключительно по фану — иначе заснешь на 12й странице / на второй домашке курса etc.

У Виктора вышел классный пост с тремя разными доказательствами почему L1-регуляризация таки зануляет веса признаков, и одно из них через теорему Куна-Такера (судя по частоте упоминаний, она у Вити одна из любимых).

Не помню чтобы нам на отделении геофизики рассказывали теорему Куна-Такера, зато был алгоритм Кули-Тьюки — причем существенно так был, ведь громадное число курсов было сфокусировано на преобразовании Фурье (уверен что курс ТФКП был только из-за него, а алгоритмы и годовой курс вычмата -- только из-за БПФ) и связанных вещах (или извращениях вроде кепстров и гомоморфных фильтраций).

Так вот, этот Тьюки написал совершенно замечательный учебник Exploratory Data Analysis — это и практическое руководство как выкрутится когда в статьи принимают только монохромные картинки (1977 год, на секундочку — никаких тебе d3.js и plotly) так, чтобы они были читаемыми (после всех игр со значками, точками, шрифтами и отступами), и сборник задач на интерпретацию и / или визуализацию вполне реальных экспериментов из статей 50-60-х, так и куча вполне практических приемов (большинство которых безнадежно устарели) с которыми вы вряд ли встретитесь — например, как округлять осьмушки в десятичные шкалы, как печатать если бумага не того размера и имеет сероватый оттенок — все это вперемешку с шутейками в стиле шоу Фрая и Лори.

Так что если у вас впереди пара долгих перелетов и вы любите анализ и визуализацию данных — искренне советую, максимум удовольствия.
Такое вот отпускное чтиво

2.2K views15:18

Дата канальи — про «специалистов» в данных / ML / AI

Вот искренне не понимаю, что движет Senior HR Manager выкладывать в проф сети такие фото 🤷 Мб я действительно не понимаю как это работает 🤔

Upd: в комментах выяснили что начальство заставляет ставить такие аватары чтобы повысить отклики кандидатов, более того, парням-рекрутерам ставят аватары девушек для той же цели 😱

1.5K viewsedited 19:52

Дата канальи — про «специалистов» в данных / ML / AI

Когда все пишут про агентов, огромные контексты, копайлоты и прочие чудеса мысли и технологии, кто-то упорно доказывает что SMOTE и другие нехорошие семплинги таргетов -- это плохо (2025й год на дворе так-то) .

И ладно бы, но глаз зацепил RUSBoostClassifier. Вот уж неожиданно, но, вроде, просто совпадение.

Хотя в NgBoost название двойное -- и natural gradients и Эндрю Ын (Ng) в авторах.

А на картинке -- как себе представил RUSBoostClassifier Кандинский 3.1 от Сбера (не буду советовать SMOTE, но и для диффузионок есть подходы в части баланса классов)

PPS. ложная тревога -- в авторах метода русских не видно:

https://ieeexplore.ieee.org/document/4717268

1.6K viewsedited 01:40

Дата канальи — про «специалистов» в данных / ML / AI

И Саша классный и доклад его классный )

1.3K views17:37

Дата канальи — про «специалистов» в данных / ML / AI

Forwarded from Big Ledovsky | блог DS лида

IML_25_Ледовский_Ранжирование_платных.pdf

26.2 MB

Презентация моего доклада на IML

Видео доклада выйдет через несколько месяцев, а пока могу поделиться слайдами (уже несколько человек спрашивало).

Можете задавать вопросы прямо сюда!

1.3K views17:37

Дата канальи — про «специалистов» в данных / ML / AI

Forwarded from Александра Сытник

Тренировки по ML

➖

2️⃣

3️⃣ мая состоится следующая встреча тренировок по машинному обучению ↩️

В рамках этого занятия обсудим соревнования по рекомендательным системам:
⚪️разберем разновидности задач (классическая рекомендательная система, ранжирование и более экзотические постановки)
⚪️сделаем обзор соревнований и их решений за последние несколько лет
⚪️посмотрим на основные подходы к решениям на примере некоторых соревнований, в которых участвовал приглашенный эксперт

📢 Спикер: Михаил Каменщиков, руководитель команды рекомендаций в Авито, Kaggle Master, призер конкурсов по рекомендательным системам, преподаватель ML System Design в Академии Аналитиков Авито

📆

Когда: 23 мая с 18:10

🗺️

Где: Покровский бульвар, 11, ауд. S224

Подробнее про челленджи

🐭

Студентам других вузов необходимо заполнить форму для заказа пропуска не позднее чем за 24 часа до дня проведения тренировок, по организационным вопросам вы можете обращаться к Александре

▶️

Please open Telegram to view this post

VIEW IN TELEGRAM

1.4K views06:31

Дата канальи — про «специалистов» в данных / ML / AI

Напоминаю , что вечером тренировка — будем рады видеть всех )

1.5K views06:32

Дата канальи — про «специалистов» в данных / ML / AI

Выступали сегодня с коллегой из MTS AI перед студентами ШАД МТС.
Коллега — Senior CV-инженер. Когда его студенты спросили — пошел бы он сегодня в CV будь он на их месте, он уверенно ответил — «нет, я бы в LLM, вон visual transformer такой же трансформер как в LLM».

Здесь меня накрыли флэшбеки — я хорошо помню как в 16-20х годах как раз CV был модной темой, особенно 3D. На ICCV’19 в Сеуле был почти десяток российских CV-стартапов, в основном из Нижнего (списываю на близость интеловского RnD-центра).
Банки рисовали роадмепы по добавлению CV (в тч OCR) во все процессы — и фото заемщика в кредитный скоринг, и при входе в отделение распознавать эмоции и подсовывать «правильного менеджера» и делать скриншот сайта клиента чтобы определять «психологическую направленность» бизнеса — да мало ли фантазий у менеджеров?

В 2016 на волне успехов в CV выходили статьи что вот-вот и сингулярность наступит (Fortune как-никак, не совсем мурзилка).
Прошло 9 лет, и вот почти то же самое от BBC (вчера вышла статья)
Видимо, мы где-то около пика цикла Гартнера и надо смотреть уже на что-то новое, с llm и агентами более-менее ясно с применением и ограничениями (разве что инференс еще на пару порядков не удешевится).

Есть идеи что может быть новым прорывом? Именно в технологиях?

Сам не вижу, разве что развитие reasoning + computer use чтобы заменить офисных двуногих -- но это не тех прорыв очевидно

1.1K viewsedited 20:33

Дата канальи — про «специалистов» в данных / ML / AI

Если отвлечь синьора и дизайнера, то, кажется, можно даже понятно нарисовать как SASRec учится. Интересно, получится ли с моделями поновее и побольше -- HSTU и FUXI-alpha 🤔

782 views18:30

Дата канальи — про «специалистов» в данных / ML / AI

Сегодня попал в Сити на один форум и вынужден был слушать в панели экспертования манагеров-каналий про рекомы, чуть руку не сломал борцовским приемом «фейспалм» 🤦‍♂️.

Все эти «на самом дела» и прочие «здравые смыслы», и «я 5 лет в отрасли и знаю что нужно пользователю» 🤦‍♂️.
Ни намека на метрики и A/B, зато вопросы. В духе: А как сделать так чтобы рекомендации были социально справедливыми? Знаете ответ? «А давайте снимать только хороший, патриотический контент».
Прям в стиле песни Захар Борисовича

Для таких вот у меня есть коробок вполне публичных примеров (а после беседы с пиар-службой кейсы теперь приходится фильтровать — заметили как их стало меньше в канале? — правда, большая часть просто ушла в отложку в 2026й)

Итак, канальи думали что SJM чем короче тем лучше, и вообще одной красной кнопки «купить» достаточно.
Ха раз
Ха второй раз

Добавление доп шагов к форме регистрации или к процессу покупки — увеличивает конверсии а не уменьшает!

В их конкретных кейсах!

Другие канальи решили что если показывать что продукт популярен в соцсетях (social proof) то конверсия будет больше, но увы

А здесь вообще в одной статье собраны противоположные результаты : в одном продукте перфомят длинные тексты, в другом короткие. В одном продают простые заголовки, в другом сложные.

Пользователи охотнее делятся шортсами или длинными?
Надо проверять именно в вашем сервисе, а мб вообще в конкретной категории.
Смотрите с опаской на тех кто «знает как думает пользователь».

PS и самое вкусное, для тех кто не читал Ходжу Насреддина

На платформе Unbounce провели A/B-тест: Get MY free 30-day trial против Get YOUR 30-day trial

Результат, ожидаемо, на картинке к посту

Однажды Насреддин увидел толпу возле пруда, что рядом с мечетью. Подойдя поближе, он увидел, что в пруду тонет мулла. Люди кричали ему: "Дайте руку, почтеннейший, дайте руку! ", но тот только булькал и руки не протягивал. Тогда Насреддин подбежал и закричал: "Нате руку, почтеннейший, нате! " -- и мулла схватился. Когда люди спросили Ходжу, как ему удалось спасти муллу, он ответил:
-- Глупцы! Разве можно говорить мулле "Дайте"! Он понимает только "Нате"!

727 views19:36

2025/05/30 16:47:10
Back to Top

HTML Embed Code:

<iframe width="100%" src="https://www.tg-me.com/buyppe/webview?embed=1" title="Telegram Webview" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowfullscreen></iframe>