Vision-Language Models Trust What They Can Discern: Image and Representational Properties Governing Modality Arbitration

Publication
Proceedings Track