See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Shuoshuo, Zhang, Yizhen, Fu, Jingjing, Song, Lei, Bian, Jiang, Yang, Yujiu, Wang, Rui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
par: Zhang, Shuoshuo, et autres
Publié: (2025)
par: Zhang, Shuoshuo, et autres
Publié: (2025)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
par: Li, Zijian, et autres
Publié: (2025)
par: Li, Zijian, et autres
Publié: (2025)
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
par: Liu, Chengzhi, et autres
Publié: (2025)
par: Liu, Chengzhi, et autres
Publié: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025)
par: Zhang, Yizhen, et autres
Publié: (2025)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
par: Yang, Wei, et autres
Publié: (2025)
par: Yang, Wei, et autres
Publié: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
par: Ding, Yang, et autres
Publié: (2025)
par: Ding, Yang, et autres
Publié: (2025)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
par: Zhang, Yongchang, et autres
Publié: (2026)
par: Zhang, Yongchang, et autres
Publié: (2026)
See More, Change Less: Anatomy-Aware Diffusion for Contrast Enhancement
par: Liu, Junqi, et autres
Publié: (2025)
par: Liu, Junqi, et autres
Publié: (2025)
Do Vision Transformers See Like Humans? Evaluating their Perceptual Alignment
par: Hernández-Cámara, Pablo, et autres
Publié: (2025)
par: Hernández-Cámara, Pablo, et autres
Publié: (2025)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)
par: Chen, Kaitao, et autres
Publié: (2025)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
par: Pang, Yuqi, et autres
Publié: (2025)
par: Pang, Yuqi, et autres
Publié: (2025)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Seeing More with Less: Video Capsule Endoscopy with Multi-Task Learning
par: Werner, Julia, et autres
Publié: (2025)
par: Werner, Julia, et autres
Publié: (2025)
Supervise Less, See More: Training-free Nuclear Instance Segmentation with Prototype-Guided Prompting
par: Zhang, Wen, et autres
Publié: (2025)
par: Zhang, Wen, et autres
Publié: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
You Only Speak Once to See
par: Yang, Wenhao, et autres
Publié: (2024)
par: Yang, Wenhao, et autres
Publié: (2024)
Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
par: Long, Lin, et autres
Publié: (2025)
par: Long, Lin, et autres
Publié: (2025)
See, Think, Learn: A Self-Taught Multimodal Reasoner
par: Sharma, Sourabh, et autres
Publié: (2025)
par: Sharma, Sourabh, et autres
Publié: (2025)
See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval
par: Jeon, Mingyu, et autres
Publié: (2026)
par: Jeon, Mingyu, et autres
Publié: (2026)
See Tomorrow, Act Today: Foresight-Driven Autonomous Driving
par: Zhang, Bozhou, et autres
Publié: (2026)
par: Zhang, Bozhou, et autres
Publié: (2026)
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
par: Xu, Haolei, et autres
Publié: (2026)
par: Xu, Haolei, et autres
Publié: (2026)
FrameOracle: Learning What to See and How Much to See in Videos
par: Li, Chaoyu, et autres
Publié: (2025)
par: Li, Chaoyu, et autres
Publié: (2025)
Seeing the Arrow of Time in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
Right this way: Can VLMs Guide Us to See More to Answer Questions?
par: Liu, Li, et autres
Publié: (2024)
par: Liu, Li, et autres
Publié: (2024)
Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models
par: Peng, Kunyu, et autres
Publié: (2026)
par: Peng, Kunyu, et autres
Publié: (2026)
Seeing Clearly without Training: Mitigating Hallucinations in Multimodal LLMs for Remote Sensing
par: Liu, Yi, et autres
Publié: (2026)
par: Liu, Yi, et autres
Publié: (2026)
Seeing Text in the Dark: Algorithm and Benchmark
par: Xu, Chengpei, et autres
Publié: (2024)
par: Xu, Chengpei, et autres
Publié: (2024)
Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models
par: Zhang, Baoheng, et autres
Publié: (2026)
par: Zhang, Baoheng, et autres
Publié: (2026)
SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution
par: Wu, Rongyuan, et autres
Publié: (2023)
par: Wu, Rongyuan, et autres
Publié: (2023)
The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
par: Goyal, Karan
Publié: (2026)
par: Goyal, Karan
Publié: (2026)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026)
par: Luo, Ruilin, et autres
Publié: (2026)
Multimodal LLMs See Sentiment
par: da Silva, Neemias B., et autres
Publié: (2025)
par: da Silva, Neemias B., et autres
Publié: (2025)
Seeing is not Believing: An Identity Hider for Human Vision Privacy Protection
par: Wang, Tao, et autres
Publié: (2023)
par: Wang, Tao, et autres
Publié: (2023)
Beyond Seeing: Evaluating Multimodal LLMs on Tool-Enabled Image Perception, Transformation, and Reasoning
par: Guo, Xingang, et autres
Publié: (2025)
par: Guo, Xingang, et autres
Publié: (2025)
Seeing Right but Saying Wrong: Inter- and Intra-Layer Refinement in MLLMs without Training
par: Song, Shezheng, et autres
Publié: (2026)
par: Song, Shezheng, et autres
Publié: (2026)
Diffusion Feedback Helps CLIP See Better
par: Wang, Wenxuan, et autres
Publié: (2024)
par: Wang, Wenxuan, et autres
Publié: (2024)
Learning More by Seeing Less: Structure First Learning for Efficient, Transferable, and Human-Aligned Vision
par: Li, Tianqin, et autres
Publié: (2025)
par: Li, Tianqin, et autres
Publié: (2025)
KAN See In the Dark
par: Ning, Aoxiang, et autres
Publié: (2024)
par: Ning, Aoxiang, et autres
Publié: (2024)
Learning to See in the Extremely Dark
par: Jiang, Hai, et autres
Publié: (2025)
par: Jiang, Hai, et autres
Publié: (2025)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Documents similaires
-
PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
par: Zhang, Shuoshuo, et autres
Publié: (2025) -
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
par: Li, Zijian, et autres
Publié: (2025) -
More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
par: Liu, Chengzhi, et autres
Publié: (2025) -
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025) -
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
par: Yang, Wei, et autres
Publié: (2025)