Enregistré dans:
| Auteurs principaux: | Wang, Zhenhailong, Guo, Xuehang, Stoica, Sofia, Xu, Haiyang, Wang, Hongru, Ha, Hyeonjeong, Chen, Xiusi, Chen, Yangyi, Yan, Ming, Huang, Fei, Ji, Heng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2507.06448 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
par: Qian, Cheng, et autres
Publié: (2026)
par: Qian, Cheng, et autres
Publié: (2026)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software Engineering
par: Guo, Xuehang, et autres
Publié: (2025)
par: Guo, Xuehang, et autres
Publié: (2025)
Open Vocabulary Electroencephalography-To-Text Decoding and Zero-shot Sentiment Classification
par: Wang, Zhenhailong, et autres
Publié: (2021)
par: Wang, Zhenhailong, et autres
Publié: (2021)
DecisionFlow: Advancing Large Language Model as Principled Decision Maker
par: Chen, Xiusi, et autres
Publié: (2025)
par: Chen, Xiusi, et autres
Publié: (2025)
Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning
par: Zhang, Xuejun, et autres
Publié: (2026)
par: Zhang, Xuejun, et autres
Publié: (2026)
Multimodal Policy Internalization for Conversational Agents
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
SMART: Self-Aware Agent for Tool Overuse Mitigation
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Acting Less is Reasoning More! Teaching Model to Act Efficiently
par: Wang, Hongru, et autres
Publié: (2025)
par: Wang, Hongru, et autres
Publié: (2025)
SYNTHIA: Novel Concept Design with Affordance Composition
par: Ha, Hyeonjeong, et autres
Publié: (2025)
par: Ha, Hyeonjeong, et autres
Publié: (2025)
RM-R1: Reward Modeling as Reasoning
par: Chen, Xiusi, et autres
Publié: (2025)
par: Chen, Xiusi, et autres
Publié: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2024)
par: Wang, Zhenhailong, et autres
Publié: (2024)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
par: Jiang, Chaoya, et autres
Publié: (2025)
par: Jiang, Chaoya, et autres
Publié: (2025)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
par: Chen, Yangyi, et autres
Publié: (2024)
par: Chen, Yangyi, et autres
Publié: (2024)
Analyzing and Internalizing Complex Policy Documents for LLM Agents
par: Liu, Jiateng, et autres
Publié: (2025)
par: Liu, Jiateng, et autres
Publié: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
ToolRL: Reward is All Tool Learning Needs
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions
par: Acikgoz, Emre Can, et autres
Publié: (2025)
par: Acikgoz, Emre Can, et autres
Publié: (2025)
ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges
par: Qian, Cheng, et autres
Publié: (2025)
par: Qian, Cheng, et autres
Publié: (2025)
Beyond Sample-Level Feedback: Using Reference-Level Feedback to Guide Data Synthesis
par: Mehri, Shuhaib, et autres
Publié: (2025)
par: Mehri, Shuhaib, et autres
Publié: (2025)
Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models
par: Shashidhar, Sumuk, et autres
Publié: (2023)
par: Shashidhar, Sumuk, et autres
Publié: (2023)
Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
par: Chen, Yangyi, et autres
Publié: (2025)
par: Chen, Yangyi, et autres
Publié: (2025)
Decoding the Critique Mechanism in Large Reasoning Models
par: Phan, Hoang, et autres
Publié: (2026)
par: Phan, Hoang, et autres
Publié: (2026)
Scaling Laws for Predicting Downstream Performance in LLMs
par: Chen, Yangyi, et autres
Publié: (2024)
par: Chen, Yangyi, et autres
Publié: (2024)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning
par: Wei, Jiaqi, et autres
Publié: (2026)
par: Wei, Jiaqi, et autres
Publié: (2026)
NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding
par: Ha, Hyeonjeong, et autres
Publié: (2026)
par: Ha, Hyeonjeong, et autres
Publié: (2026)
MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
par: Ha, Hyeonjeong, et autres
Publié: (2025)
par: Ha, Hyeonjeong, et autres
Publié: (2025)
Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboration
par: Wang, Zhenhailong, et autres
Publié: (2023)
par: Wang, Zhenhailong, et autres
Publié: (2023)
DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
par: Zhu, Lanyun, et autres
Publié: (2025)
par: Zhu, Lanyun, et autres
Publié: (2025)
BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
par: Zhan, Qiusi, et autres
Publié: (2025)
par: Zhan, Qiusi, et autres
Publié: (2025)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
par: Jia, Hongrui, et autres
Publié: (2024)
par: Jia, Hongrui, et autres
Publié: (2024)
PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding
par: Blume, Ansel, et autres
Publié: (2025)
par: Blume, Ansel, et autres
Publié: (2025)
Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
par: Wang, Zehong, et autres
Publié: (2026)
par: Wang, Zehong, et autres
Publié: (2026)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
par: Jiang, Bingqing, et autres
Publié: (2026)
par: Jiang, Bingqing, et autres
Publié: (2026)
SafeSwitch: Steering Unsafe LLM Behavior via Internal Activation Signals
par: Han, Peixuan, et autres
Publié: (2025)
par: Han, Peixuan, et autres
Publié: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
par: Li, Gang, et autres
Publié: (2025)
par: Li, Gang, et autres
Publié: (2025)
SCAFusion: A Multimodal 3D Detection Framework for Small Object Detection in Lunar Surface Exploration
par: Chen, Xin, et autres
Publié: (2025)
par: Chen, Xin, et autres
Publié: (2025)
Documents similaires
-
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
par: Qian, Cheng, et autres
Publié: (2026) -
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
par: Wang, Zhenhailong, et autres
Publié: (2025) -
SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software Engineering
par: Guo, Xuehang, et autres
Publié: (2025) -
Open Vocabulary Electroencephalography-To-Text Decoding and Zero-shot Sentiment Classification
par: Wang, Zhenhailong, et autres
Publié: (2021) -
DecisionFlow: Advancing Large Language Model as Principled Decision Maker
par: Chen, Xiusi, et autres
Publié: (2025)