Дослідники навчили мовну модель малювати акварелі методом навчання з підкріпленням

Training a coding model to paint watercolours with TRL and OpenEnv

Автор блогу Hugging Face відтворив вірусний експеримент Сур'ї Нарредді, у якому мовна модель пише JavaScript-код для малювання акварелей через бібліотеку p5.brush. Модель Qwen3.5-35B-A3B навчили методом GRPO, порівнявши три варіанти функції винагороди на основі моделі естетичної оцінки HPSv3 та парного судді на базі Qwen3-VL. Усі скрипти, дані, RL-середовище та навчені моделі опубліковано у відкритому доступі на Hugging Face.

Мовою оригіналу · EN

This Hugging Face blog post reproduces Surya Narreddi's viral watercolour-painting experiment, training a coding model (Qwen3.5-35B-A3B) with reinforcement learning (GRPO) to write JavaScript via the…

Читати оригінал на Hugging Face →

Чому в стрічці: Конкретна технічна розробка в AI з відкритим кодом від Hugging Face — джерела, якому користувач довіряє.

← Назад до стрічки