Enregistré dans:
| Auteur principal: | Zhou, Yunpeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.25075 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents
par: Zhou, Yunpeng
Publié: (2026)
par: Zhou, Yunpeng
Publié: (2026)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
par: Liu, Xiwei, et autres
Publié: (2026)
par: Liu, Xiwei, et autres
Publié: (2026)
A Resource-Rational Principle for Modeling Visual Attention Control
par: Bai, Yunpeng
Publié: (2026)
par: Bai, Yunpeng
Publié: (2026)
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
par: Che, Liwei, et autres
Publié: (2026)
par: Che, Liwei, et autres
Publié: (2026)
Language Model Circuits Are Sparse in the Neuron Basis
par: Arora, Aryaman, et autres
Publié: (2026)
par: Arora, Aryaman, et autres
Publié: (2026)
Balanced Thinking: Improving Chain of Thought Training in Vision Language Models
par: Perek, Shaked, et autres
Publié: (2026)
par: Perek, Shaked, et autres
Publié: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
par: Zhao, Qingqing, et autres
Publié: (2025)
par: Zhao, Qingqing, et autres
Publié: (2025)
Moving Pictures of Thought: Extracting Visual Knowledge in Charles S. Peirce's Manuscripts with Vision-Language Models
par: Pedretti, Carlo Teo, et autres
Publié: (2025)
par: Pedretti, Carlo Teo, et autres
Publié: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
par: Zhou, Qiji, et autres
Publié: (2024)
par: Zhou, Qiji, et autres
Publié: (2024)
VCoT-Grasp: Grasp Foundation Models with Visual Chain-of-Thought Reasoning for Language-driven Grasp Generation
par: Zhang, Haoran, et autres
Publié: (2025)
par: Zhang, Haoran, et autres
Publié: (2025)
AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
par: Wen, Yibin, et autres
Publié: (2025)
par: Wen, Yibin, et autres
Publié: (2025)
Structural Instability of Feature Composition
par: Zhou, Yunpeng
Publié: (2026)
par: Zhou, Yunpeng
Publié: (2026)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
par: Chen, Xiaoshu, et autres
Publié: (2026)
par: Chen, Xiaoshu, et autres
Publié: (2026)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
par: Wu, Jialin, et autres
Publié: (2026)
par: Wu, Jialin, et autres
Publié: (2026)
Sparse Probabilistic Graph Circuits
par: Rektoris, Martin, et autres
Publié: (2025)
par: Rektoris, Martin, et autres
Publié: (2025)
Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models
par: Marks, Samuel, et autres
Publié: (2024)
par: Marks, Samuel, et autres
Publié: (2024)
CoT-VLM4Tar: Chain-of-Thought Guided Vision-Language Models for Traffic Anomaly Resolution
par: Ren, Tianchi, et autres
Publié: (2025)
par: Ren, Tianchi, et autres
Publié: (2025)
GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models
par: Shi, Nannan, et autres
Publié: (2025)
par: Shi, Nannan, et autres
Publié: (2025)
VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models
par: Lim, Hyesu, et autres
Publié: (2026)
par: Lim, Hyesu, et autres
Publié: (2026)
Interactive Reasoning: Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models
par: Pang, Rock Yuren, et autres
Publié: (2025)
par: Pang, Rock Yuren, et autres
Publié: (2025)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
par: Tian, Xinyu, et autres
Publié: (2025)
par: Tian, Xinyu, et autres
Publié: (2025)
Visual Distraction Undermines Moral Reasoning in Vision-Language Models
par: Yang, Xinyi, et autres
Publié: (2026)
par: Yang, Xinyi, et autres
Publié: (2026)
Pixelis: Reasoning in Pixels, from Seeing to Acting
par: Zhou, Yunpeng
Publié: (2026)
par: Zhou, Yunpeng
Publié: (2026)
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
par: Zhou, Yuhao, et autres
Publié: (2026)
par: Zhou, Yuhao, et autres
Publié: (2026)
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
par: Gao, Yunpeng, et autres
Publié: (2024)
par: Gao, Yunpeng, et autres
Publié: (2024)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
par: Yang, Yankai, et autres
Publié: (2026)
par: Yang, Yankai, et autres
Publié: (2026)
Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy
par: Shen, Xu, et autres
Publié: (2026)
par: Shen, Xu, et autres
Publié: (2026)
How does Chain of Thought Think? Mechanistic Interpretability of Chain-of-Thought Reasoning with Sparse Autoencoding
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
Modeling Language as a Sequence of Thoughts
par: Borazjanizadeh, Nasim, et autres
Publié: (2025)
par: Borazjanizadeh, Nasim, et autres
Publié: (2025)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
par: Zhou, Lijie
Publié: (2026)
par: Zhou, Lijie
Publié: (2026)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
par: Jin, Xinchen, et autres
Publié: (2026)
par: Jin, Xinchen, et autres
Publié: (2026)
Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models
par: Ye, Jiacheng, et autres
Publié: (2024)
par: Ye, Jiacheng, et autres
Publié: (2024)
CircuitFormer: A Circuit Language Model for Analog Topology Design from Natural Language Prompt
par: Islam, Md Touhidul, et autres
Publié: (2026)
par: Islam, Md Touhidul, et autres
Publié: (2026)
Synthesizing Visual Concepts as Vision-Language Programs
par: Wüst, Antonia, et autres
Publié: (2025)
par: Wüst, Antonia, et autres
Publié: (2025)
SAUCE: Selective Concept Unlearning in Vision-Language Models with Sparse Autoencoders
par: Li, Qing, et autres
Publié: (2025)
par: Li, Qing, et autres
Publié: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
par: Li, Anqi, et autres
Publié: (2025)
par: Li, Anqi, et autres
Publié: (2025)
Latent Chain-of-Thought for Visual Reasoning
par: Sun, Guohao, et autres
Publié: (2025)
par: Sun, Guohao, et autres
Publié: (2025)
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
par: Pach, Mateusz, et autres
Publié: (2025)
par: Pach, Mateusz, et autres
Publié: (2025)
Thought of Search: Planning with Language Models Through The Lens of Efficiency
par: Katz, Michael, et autres
Publié: (2024)
par: Katz, Michael, et autres
Publié: (2024)
Chain-of-Thought in Large Language Models: Decoding, Projection, and Activation
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Documents similaires
-
Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents
par: Zhou, Yunpeng
Publié: (2026) -
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
par: Liu, Xiwei, et autres
Publié: (2026) -
A Resource-Rational Principle for Modeling Visual Attention Control
par: Bai, Yunpeng
Publié: (2026) -
Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models
par: Che, Liwei, et autres
Publié: (2026) -
Language Model Circuits Are Sparse in the Neuron Basis
par: Arora, Aryaman, et autres
Publié: (2026)