Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiong, Yuqi, Peng, Chunyi, Xu, Zhipeng, Liu, Zhenghao, Chen, Zulong, Yan, Yukun, Wang, Shuo, Gu, Yu, Yu, Ge |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation
di: Peng, Chunyi, et al.
Pubblicazione: (2025)
di: Peng, Chunyi, et al.
Pubblicazione: (2025)
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
di: Liu, Zhenghao, et al.
Pubblicazione: (2026)
di: Liu, Zhenghao, et al.
Pubblicazione: (2026)
Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction
di: Gao, Xingjie, et al.
Pubblicazione: (2026)
di: Gao, Xingjie, et al.
Pubblicazione: (2026)
LISRec: Modeling User Preferences with Learned Item Shortcuts for Sequential Recommendation
di: Xin, Haidong, et al.
Pubblicazione: (2025)
di: Xin, Haidong, et al.
Pubblicazione: (2025)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
di: Xu, Zhipeng, et al.
Pubblicazione: (2024)
di: Xu, Zhipeng, et al.
Pubblicazione: (2024)
Say More with Less: Understanding Prompt Learning Behaviors through Gist Compression
di: Li, Xinze, et al.
Pubblicazione: (2024)
di: Li, Xinze, et al.
Pubblicazione: (2024)
Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
ReCUT: Balancing Reasoning Length and Accuracy in LLMs via Stepwise Trails and Preference Optimization
di: Jin, Zhensheng, et al.
Pubblicazione: (2025)
di: Jin, Zhensheng, et al.
Pubblicazione: (2025)
Enhancing the Patent Matching Capability of Large Language Models via the Memory Graph
di: Xiong, Qiushi, et al.
Pubblicazione: (2025)
di: Xiong, Qiushi, et al.
Pubblicazione: (2025)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
di: Sun, Yubo, et al.
Pubblicazione: (2025)
di: Sun, Yubo, et al.
Pubblicazione: (2025)
MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization
di: Xin, Haidong, et al.
Pubblicazione: (2026)
di: Xin, Haidong, et al.
Pubblicazione: (2026)
Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
di: Ji, Yifan, et al.
Pubblicazione: (2026)
di: Ji, Yifan, et al.
Pubblicazione: (2026)
ThinkNote: Enhancing Knowledge Integration and Utilization of Large Language Models via Constructivist Cognition Modeling
di: Xu, Zhipeng, et al.
Pubblicazione: (2024)
di: Xu, Zhipeng, et al.
Pubblicazione: (2024)
LegalDuet: Learning Fine-grained Representations for Legal Judgment Prediction via a Dual-View Contrastive Learning
di: Xu, Buqiang, et al.
Pubblicazione: (2024)
di: Xu, Buqiang, et al.
Pubblicazione: (2024)
Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain
di: Dai, Xin, et al.
Pubblicazione: (2025)
di: Dai, Xin, et al.
Pubblicazione: (2025)
COAST: Enhancing the Code Debugging Ability of LLMs through Communicative Agent Based Data Synthesis
di: Yang, Weiqing, et al.
Pubblicazione: (2024)
di: Yang, Weiqing, et al.
Pubblicazione: (2024)
RankCoT: Refining Knowledge for Retrieval-Augmented Generation through Ranking Chain-of-Thoughts
di: Wu, Mingyan, et al.
Pubblicazione: (2025)
di: Wu, Mingyan, et al.
Pubblicazione: (2025)
Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking
di: Ji, Yifan, et al.
Pubblicazione: (2025)
di: Ji, Yifan, et al.
Pubblicazione: (2025)
Empirical Analysis of Decoding Biases in Masked Diffusion Models
di: Huang, Pengcheng, et al.
Pubblicazione: (2025)
di: Huang, Pengcheng, et al.
Pubblicazione: (2025)
Building A Coding Assistant via the Retrieval-Augmented Language Model
di: Li, Xinze, et al.
Pubblicazione: (2024)
di: Li, Xinze, et al.
Pubblicazione: (2024)
ExpandR: Teaching Dense Retrievers Beyond Queries with LLM Guidance
di: Yao, Sijia, et al.
Pubblicazione: (2025)
di: Yao, Sijia, et al.
Pubblicazione: (2025)
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
di: Chen, Zhenghao, et al.
Pubblicazione: (2026)
di: Chen, Zhenghao, et al.
Pubblicazione: (2026)
Revealing the Attention Floating Mechanism in Masked Diffusion Models
di: Dai, Xin, et al.
Pubblicazione: (2026)
di: Dai, Xin, et al.
Pubblicazione: (2026)
Structured Knowledge Representation through Contextual Pages for Retrieval-Augmented Generation
di: Li, Xinze, et al.
Pubblicazione: (2026)
di: Li, Xinze, et al.
Pubblicazione: (2026)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
di: Wang, Ante, et al.
Pubblicazione: (2024)
di: Wang, Ante, et al.
Pubblicazione: (2024)
A Tensor-EM Method for Large-Scale Latent Class Analysis with Binary Responses
di: Zeng, Zhenghao, et al.
Pubblicazione: (2021)
di: Zeng, Zhenghao, et al.
Pubblicazione: (2021)
Modeling User Viewing Flow Using Large Language Models for Article Recommendation
di: Liu, Zhenghao, et al.
Pubblicazione: (2023)
di: Liu, Zhenghao, et al.
Pubblicazione: (2023)
Act2See: Emergent Active Visual Perception for Video Reasoning
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization
di: Wang, Haolan, et al.
Pubblicazione: (2025)
di: Wang, Haolan, et al.
Pubblicazione: (2025)
Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
di: Duan, Shaohua, et al.
Pubblicazione: (2025)
di: Duan, Shaohua, et al.
Pubblicazione: (2025)
ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models
di: Liu, Jiaxin, et al.
Pubblicazione: (2025)
di: Liu, Jiaxin, et al.
Pubblicazione: (2025)
Towards the State Space Interpretation (SSI): A Formalized Framework for Game Studies and Design
di: Wang, Zhenghao, et al.
Pubblicazione: (2025)
di: Wang, Zhenghao, et al.
Pubblicazione: (2025)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
di: Wu, Xueqing, et al.
Pubblicazione: (2024)
di: Wu, Xueqing, et al.
Pubblicazione: (2024)
CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing
di: Xu, Zhipeng, et al.
Pubblicazione: (2026)
di: Xu, Zhipeng, et al.
Pubblicazione: (2026)
MARVEL: Unlocking the Multi-Modal Capability of Dense Retrieval via Visual Module Plugin
di: Zhou, Tianshuo, et al.
Pubblicazione: (2023)
di: Zhou, Tianshuo, et al.
Pubblicazione: (2023)
Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning
di: Yang, Jingru, et al.
Pubblicazione: (2024)
di: Yang, Jingru, et al.
Pubblicazione: (2024)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
di: Dönmez, Esra, et al.
Pubblicazione: (2026)
di: Dönmez, Esra, et al.
Pubblicazione: (2026)
KBAlign: Efficient Self Adaptation on Specific Knowledge Bases
di: Zeng, Zheni, et al.
Pubblicazione: (2024)
di: Zeng, Zheni, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment
di: Yang, Hao, et al.
Pubblicazione: (2026) -
Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation
di: Peng, Chunyi, et al.
Pubblicazione: (2025) -
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
di: Liu, Zhenghao, et al.
Pubblicazione: (2026) -
Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction
di: Gao, Xingjie, et al.
Pubblicazione: (2026) -
LISRec: Modeling User Preferences with Learned Item Shortcuts for Sequential Recommendation
di: Xin, Haidong, et al.
Pubblicazione: (2025)