Дослідники навчили мовну модель малювати акварелі методом навчання з підкріпленням
Training a coding model to paint watercolours with TRL and OpenEnv

Автор блогу Hugging Face відтворив вірусний експеримент Сур'ї Нарредді, у якому мовна модель пише JavaScript-код для малювання акварелей через бібліотеку p5.brush. Модель Qwen3.5-35B-A3B навчили методом GRPO, порівнявши три варіанти функції винагороди на основі моделі естетичної оцінки HPSv3 та парного судді на базі Qwen3-VL. Усі скрипти, дані, RL-середовище та навчені моделі опубліковано у відкритому доступі на Hugging Face.
Мовою оригіналу · EN
This Hugging Face blog post reproduces Surya Narreddi's viral watercolour-painting experiment, training a coding model (Qwen3.5-35B-A3B) with reinforcement learning (GRPO) to write JavaScript via the…
Читати оригінал на Hugging Face →
Чому в стрічці: Конкретна технічна розробка в AI з відкритим кодом від Hugging Face — джерела, якому користувач довіряє.