Разборы, кейсы и практика для инженеров и продактов. Как строить AI-продукты и не терять на этом деньги.

Погружение в LLM часть первая

Я тут начал погружаться в LLM чуть глубже и лично для меня гораздо проще начинать погружение через практику.

Таким образом можно понять все ключевые концепции и наметить себе список пейперов для дальнейшего ознакомления.

Начал я с заметки StackLLaMA: A hands-on guide to train LLaMA with RLHF

Тут вы сразу сможете ознакомиться с концепциями Reinforcement Learning from Human Feedback, эффективной тренировкой с помощью LoRA, PPO.

Так же вы познакомитесь с зоопарком библиотек huggingface: accelerate, bitsandbytes, peft и trl.

В заметке используется StackExchange датасет, но для разнообразия могу посоветовать вам использовать датасет Anthropic/hh-rlhf

Во второй части пройдемся по ключевым пейперам

Помогаю бизнесу внедрять LLM и GenAI в продукт если у вас конкретная задача, можно записаться на консультацию

Share it
Ренат Алимбеков
Ренат Алимбеков — ML-инженер и консультант, 18 лет в IT. Провожу ML/Data Science консультации и менторинг по Data Science — онлайн и очно в Алматы.
Понравилась заметка? Подписывайтесь на телеграм — @renat_alimbekov.

Интересные записи в этой рубрике: