Разборы, кейсы и практика для инженеров и продактов. Как строить AI-продукты и не терять на этом деньги.

Консультации по машинному обучению и внедрению ИИ

Разбор вашей задачи практиком, который запускает AI-системы в проде. Онлайн, 60 или 90 минут, запись и оплата на сайте.

Последние пару лет ко мне регулярно приходят с одними и теми же вопросами. Как встроить LLM в продукт и не разориться на токенах. Почему модель показывает хорошие метрики в ноутбуке, но не доезжает до прода. Нужен ли здесь вообще машинное обучение или хватит правил. Отвечал в личке, на созвонах, иногда в комментариях. Теперь для этого есть отдельная страница: consultation.alimbekov.com

консультации по машинному обучению и внедрению ИИ

Читать далее

Как войти в Data Science в Казахстане

Меня часто спрашивают, с чего начать. Отвечаю по-разному, потому что универсального ответа нет, но есть несколько вещей, которые повторяю почти всем. Собрал их здесь.

Как я сам сюда попал

Образование у меня математическое, мехмат КазНУ, математическое моделирование. Специальности дата-сайентист тогда не существовало, направления такого не было. При том что математики и программирования на факультете хватало, меня занесло в веб-разработку, и я довольно долго ей занимался с 2006 года.

Потом я оказался в банке. Там было много задач с большими объёмами данных, в основном про транзакционный фрод. Компетенции для этого были нужны внутри, а у меня оказался самый близкий технический бэкграунд. Начал заниматься, и мне понравилось больше, чем тем, что я делал до этого.

Два фактора: удачное стечение обстоятельств и то, что зашло. Никакого продуманного перехода не было.

Откуда берутся дата-специалисты

Откуда берутся дата-специалисты

Из моих наблюдений за теми, кто начинал примерно тогда же: большинство пришли из разработки. Есть заметная часть экономистов, у них своя сильная база по эконометрике и статистике, технически они послабее, но добирали навыки на ходу.

Общее у всех одно. Технический склад и какая-то математика за спиной, пусть даже подзабытая. Когда база есть, остальное добивается.

Тогда в казахстанских вузах не было четырёхлетней специализации по DS, и людям приходилось собирать себя самим. Сейчас программы появились (Data Science в МУИТ, в Astana IT University, магистратура по ML в Сатпаева), так что этот пункт можно считать закрытым для тех, кто поступает сегодня.

Читать далее

Pandas для Data Science: полное руководство с примерами

Этой заметкой открываю серию статей для начинающих вкатываться в Data Sciеnce и Machine Learning и начнем мы с изучения Pandas. В интернете много статей по Pandas, поэтому хотел бы в этой заметки описать практические приемы для работы с Pandas в Data Sciеnce проектах и для построения моделей.

В качестве датасета будем использовать German Credit Risk на Kaggle

Датасет содержит информацию о кредитных данных:

  • Age (возраст)
  • Sex (пол)
  • Job (работа)
  • Housing (тип жилья)
  • Saving accounts (сберегательные счета)
  • Checking account (расчетный счет)
  • Credit amount (сумма кредита)
  • Duration (продолжительность кредита)
  • Purpose (цель кредита)
Pandas для Data Science

Читать далее

Погружение в LLM часть вторая

В первой части мы разобрали практическую часть погружения в LLM.

В этой части мы поговорим про ключевые пейперы, которые помогут в понимании LLM и прохождение собеседований =) Но об этом позже.

Все начинается с первой гпт

Затем рекомендую прочитать работу про InstructGPT. Там раскрыта тема обучения с фидбеком от человека.

Дальше есть пара интересных пейперов:

Затем рекомендую ознакомиться с двумя воистину знаковых пейпера: LORA и QLORA, которые решают следующие проблемы:

  • скорость обучения
  • вычислительные ресурсы
  • эффективность памяти

Еще два не менее важных пейпера PPO и DPO. Понимание этих работ поможет в ревард моделинге.

Ну и на последок:

Всем приятного чтения

Помогаю бизнесу внедрять LLM и GenAI в продукт если у вас конкретная задача, можно записаться на консультацию

Machine learning pipeline — основы. Cookiecutter и Hydra

В курсах по Data Science домашние работы и проекты делаются в Jupyter Notebooks и студентов не учат писать пайплайны. Дело в том, что работа в Jupyter Notebooks не смотря на удобство несет в себе в том числе и недостатки. Например, вы строите несколько типов моделей с несколькими вариантами заполнения пропусков (среднее, медиана), генерируете набор feature engineering и применяете разные варианты разбиения выборки.

Можно разместить весь этот код в один Jupyter Notebooks и логгировать метрики и конфиги. Код получится громоздкий и не поворотливый. Для запуска экспериментов надо будет или перескакивать или комментировать ячейки, которые не нужно запускать.

Для решения этих проблем рекомендую использовать pipeline для автоматизации рабочих процессов машинного обучения. Основная цель создания пайплайна — это контроль. Хорошо организованный пайплайн делает реализацию более гибкой.

Читать далее