Research3w ago
Preprint reports stronger reward steering for an AI language model
A preprint details inference-time methods that steer a discrete diffusion language model toward sequence-level rewards without retraining, favoring nested…
#AI#Preprint#Language Model#Diffusion#Inference#LLM