What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Haoxi, Hou, Qinglin, Ma, Jianfei, Lai, Jinxiang, Han, Tao, Bai, Sikai, Guo, Jingcai, Zhang, Jie, Guo, Song |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoRE: Enhancing Metacognition with Label-free Self-evaluation in LRMs
par: Li, Haoxi, et autres
Publié: (2025)
par: Li, Haoxi, et autres
Publié: (2025)
Vision Language Models See What You Want but not What You See
par: Gao, Qingying, et autres
Publié: (2024)
par: Gao, Qingying, et autres
Publié: (2024)
What You See is What You Ask: Evaluating Audio Descriptions
par: Kala, Divy, et autres
Publié: (2025)
par: Kala, Divy, et autres
Publié: (2025)
What You See is What You Classify: Black Box Attributions
par: Stalder, Steven, et autres
Publié: (2022)
par: Stalder, Steven, et autres
Publié: (2022)
DiPrompT: Disentangled Prompt Tuning for Multiple Latent Domain Generalization in Federated Learning
par: Bai, Sikai, et autres
Publié: (2024)
par: Bai, Sikai, et autres
Publié: (2024)
DiEP: Adaptive Mixture-of-Experts Compression through Differentiable Expert Pruning
par: Bai, Sikai, et autres
Publié: (2025)
par: Bai, Sikai, et autres
Publié: (2025)
TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis
par: Bai, Sikai, et autres
Publié: (2026)
par: Bai, Sikai, et autres
Publié: (2026)
Spatially Selective Imaging in Color: What You See is What You Want
par: John You En Chan, et autres
Publié: (2024)
par: John You En Chan, et autres
Publié: (2024)
What You See is Not What You Get: Neural Partial Differential Equations and The Illusion of Learning
par: Mohan, Arvind, et autres
Publié: (2024)
par: Mohan, Arvind, et autres
Publié: (2024)
What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code
par: Wen, Jiawen, et autres
Publié: (2024)
par: Wen, Jiawen, et autres
Publié: (2024)
What You Read Isn't What You Hear: Linguistic Sensitivity in Deepfake Speech Detection
par: Nguyen, Binh, et autres
Publié: (2025)
par: Nguyen, Binh, et autres
Publié: (2025)
More Compute Is What You Need
par: Guo, Zhen
Publié: (2024)
par: Guo, Zhen
Publié: (2024)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
par: Liu, Xiulong, et autres
Publié: (2024)
par: Liu, Xiulong, et autres
Publié: (2024)
What You See Is What Matters: A Novel Visual and Physics-Based Metric for Evaluating Video Generation Quality
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
You Are What You Say: Exploiting Linguistic Content for VoicePrivacy Attacks
par: Gaznepoglu, Ünal Ege, et autres
Publié: (2025)
par: Gaznepoglu, Ünal Ege, et autres
Publié: (2025)
See What You Are Told: Visual Attention Sink in Large Multimodal Models
par: Kang, Seil, et autres
Publié: (2025)
par: Kang, Seil, et autres
Publié: (2025)
What You See is (Usually) What You Get: Multimodal Prototype Networks that Abstain from Expensive Modalities
par: Bahng, Muchang, et autres
Publié: (2025)
par: Bahng, Muchang, et autres
Publié: (2025)
What You See Is What You Get: Attention-based Self-guided Automatic Unit Test Generation
par: Yin, Xin, et autres
Publié: (2024)
par: Yin, Xin, et autres
Publié: (2024)
Seeing What You Say: Expressive Image Generation from Speech
par: Lee, Jiyoung, et autres
Publié: (2025)
par: Lee, Jiyoung, et autres
Publié: (2025)
Not All Tokens Are What You Need In Thinking
par: Yuan, Hang, et autres
Publié: (2025)
par: Yuan, Hang, et autres
Publié: (2025)
See Where You Read with Eye Gaze Tracking and Large Language Model
par: Yang, Sikai, et autres
Publié: (2024)
par: Yang, Sikai, et autres
Publié: (2024)
Learning to See What You Need: Gaze Attention for Multimodal Large Language Models
par: Song, Junha, et autres
Publié: (2026)
par: Song, Junha, et autres
Publié: (2026)
What LLMs Think When You Don't Tell Them What to Think About?
par: Kwon, Yongchan, et autres
Publié: (2026)
par: Kwon, Yongchan, et autres
Publié: (2026)
What You See Is What It Does: A Structural Pattern for Legible Software
par: Meng, Eagon, et autres
Publié: (2025)
par: Meng, Eagon, et autres
Publié: (2025)
What You See is What You GAN: Rendering Every Pixel for High-Fidelity Geometry in 3D GANs
par: Trevithick, Alex, et autres
Publié: (2024)
par: Trevithick, Alex, et autres
Publié: (2024)
Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models
par: Magid, Salma Abdel, et autres
Publié: (2024)
par: Magid, Salma Abdel, et autres
Publié: (2024)
Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
par: Liu, Yongjiang, et autres
Publié: (2025)
par: Liu, Yongjiang, et autres
Publié: (2025)
What Does Your Boss Think about You?
par: Lau, Debra
Publié: (2002)
par: Lau, Debra
Publié: (2002)
The Cure for Library Anxiety--It May Not Be What You Think.
par: Joseph, Miriam E.
Publié: (1991)
par: Joseph, Miriam E.
Publié: (1991)
Do You See What I See? A Qualitative Study Eliciting High-Level Visualization Comprehension
par: Quadri, Ghulam Jilani, et autres
Publié: (2024)
par: Quadri, Ghulam Jilani, et autres
Publié: (2024)
Trusting What You Cannot See: Auditable Fine-Tuning and Inference for Proprietary AI
par: Jin, Heng, et autres
Publié: (2026)
par: Jin, Heng, et autres
Publié: (2026)
Do You See What I See?: Observed Race and the Ascription of American Identity
par: Raul S. Casarez
Publié: (2025)
par: Raul S. Casarez
Publié: (2025)
Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding
par: Cho, Beomsik, et autres
Publié: (2025)
par: Cho, Beomsik, et autres
Publié: (2025)
See What You Need: Query-Aware Visual Intelligence through Reasoning-Perception Loops
par: Dong, Zixuan, et autres
Publié: (2025)
par: Dong, Zixuan, et autres
Publié: (2025)
Can You Trust What You See? Alpha Channel No-Box Attacks on Video Object Detection
par: Yi, Ariana, et autres
Publié: (2025)
par: Yi, Ariana, et autres
Publié: (2025)
Point What You Mean: Visually Grounded Instruction Policy
par: Yu, Hang, et autres
Publié: (2025)
par: Yu, Hang, et autres
Publié: (2025)
Browsing without Third-Party Cookies: What Do You See?
par: Lin, Maxwell, et autres
Publié: (2024)
par: Lin, Maxwell, et autres
Publié: (2024)
Position: Model Collapse Does Not Mean What You Think
par: Schaeffer, Rylan, et autres
Publié: (2025)
par: Schaeffer, Rylan, et autres
Publié: (2025)
Euphemisms: Tell Me What You Do and I'll Tell You What You Are!
par: Perez, Cenel Augusto
Publié: (2025)
par: Perez, Cenel Augusto
Publié: (2025)
See, Think, Act: Online Shopper Behavior Simulation with VLM Agents
par: Zhang, Yimeng, et autres
Publié: (2025)
par: Zhang, Yimeng, et autres
Publié: (2025)
Documents similaires
-
CoRE: Enhancing Metacognition with Label-free Self-evaluation in LRMs
par: Li, Haoxi, et autres
Publié: (2025) -
Vision Language Models See What You Want but not What You See
par: Gao, Qingying, et autres
Publié: (2024) -
What You See is What You Ask: Evaluating Audio Descriptions
par: Kala, Divy, et autres
Publié: (2025) -
What You See is What You Classify: Black Box Attributions
par: Stalder, Steven, et autres
Publié: (2022) -
DiPrompT: Disentangled Prompt Tuning for Multiple Latent Domain Generalization in Federated Learning
par: Bai, Sikai, et autres
Publié: (2024)