Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
VRRL reinforcement learning framework improves vision-language model self-reflection by grounding corrections in visual inputs for out-of-distribution robustness.