Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Zheng, Kutralingam, T Pranav, Okoani, Ogochukwu N, Xu, Wanpeng, Wei, Hua, Hu, Xiyang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback
par: Zhang, Wanpeng, et autres
Publié: (2023)
par: Zhang, Wanpeng, et autres
Publié: (2023)
Dynamics of Adversarial Attacks on Large Language Model-Based Search Engines
par: Hu, Xiyang
Publié: (2025)
par: Hu, Xiyang
Publié: (2025)
SUTRA: Scalable Multilingual Language Model Architecture
par: Bendale, Abhijit, et autres
Publié: (2024)
par: Bendale, Abhijit, et autres
Publié: (2024)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
par: Huang, Xu, et autres
Publié: (2024)
par: Huang, Xu, et autres
Publié: (2024)
Multilingual Collaborative Defense for Large Language Models
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias
par: Xu, Yuemei, et autres
Publié: (2024)
par: Xu, Yuemei, et autres
Publié: (2024)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
par: Zheng, Xin, et autres
Publié: (2024)
par: Zheng, Xin, et autres
Publié: (2024)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
par: Li, Zherui, et autres
Publié: (2025)
par: Li, Zherui, et autres
Publié: (2025)
Towards More Accurate US Presidential Election via Multi-step Reasoning with Large Language Models
par: Yu, Chenxiao, et autres
Publié: (2024)
par: Yu, Chenxiao, et autres
Publié: (2024)
Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments
par: Crouse, Maxwell, et autres
Publié: (2026)
par: Crouse, Maxwell, et autres
Publié: (2026)
Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict
par: Chen, Guanyu, et autres
Publié: (2026)
par: Chen, Guanyu, et autres
Publié: (2026)
"Lost-in-the-Later": Framework for Quantifying Contextual Grounding in Large Language Models
par: Tao, Yufei, et autres
Publié: (2025)
par: Tao, Yufei, et autres
Publié: (2025)
Tool Learning with Large Language Models: A Survey
par: Qu, Changle, et autres
Publié: (2024)
par: Qu, Changle, et autres
Publié: (2024)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
par: Yang, Tiankai, et autres
Publié: (2024)
par: Yang, Tiankai, et autres
Publié: (2024)
Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge
par: Zhou, Xiaolin, et autres
Publié: (2026)
par: Zhou, Xiaolin, et autres
Publié: (2026)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
par: Luo, Haipeng, et autres
Publié: (2025)
par: Luo, Haipeng, et autres
Publié: (2025)
ToolNet: Connecting Large Language Models with Massive Tools via Tool Graph
par: Liu, Xukun, et autres
Publié: (2024)
par: Liu, Xukun, et autres
Publié: (2024)
Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models
par: Kallem, Pranav
Publié: (2026)
par: Kallem, Pranav
Publié: (2026)
BiasLab: A Multilingual, Dual-Framing Framework for Robust Measurement of Output-Level Bias in Large Language Models
par: Guey, William, et autres
Publié: (2026)
par: Guey, William, et autres
Publié: (2026)
Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls
par: Zhang, Kangning, et autres
Publié: (2025)
par: Zhang, Kangning, et autres
Publié: (2025)
Identifying and Extracting Rare Disease Phenotypes with Large Language Models
par: Shyr, Cathy, et autres
Publié: (2023)
par: Shyr, Cathy, et autres
Publié: (2023)
Supernova Event Dataset: Interpreting Large Language Models' Personality through Critical Event Analysis
par: Agarwal, Pranav, et autres
Publié: (2025)
par: Agarwal, Pranav, et autres
Publié: (2025)
Instructional Agents: Reducing Teaching Faculty Workload through Multi-Agent Instructional Design
par: Yao, Huaiyuan, et autres
Publié: (2025)
par: Yao, Huaiyuan, et autres
Publié: (2025)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
par: Han, Wenhan, et autres
Publié: (2025)
par: Han, Wenhan, et autres
Publié: (2025)
MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool Calling
par: Zhu, Yakun, et autres
Publié: (2024)
par: Zhu, Yakun, et autres
Publié: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
par: Wang, Wenxuan, et autres
Publié: (2023)
par: Wang, Wenxuan, et autres
Publié: (2023)
Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching
par: Wei, Rongzhe, et autres
Publié: (2026)
par: Wei, Rongzhe, et autres
Publié: (2026)
Lost in the Pipeline: How Well Do Large Language Models Handle Data Preparation?
par: Spreafico, Matteo, et autres
Publié: (2025)
par: Spreafico, Matteo, et autres
Publié: (2025)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
par: Malik, Saumya
Publié: (2024)
par: Malik, Saumya
Publié: (2024)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
par: Ni, Shiwen, et autres
Publié: (2024)
par: Ni, Shiwen, et autres
Publié: (2024)
Multilingual Performance Biases of Large Language Models in Education
par: Gupta, Vansh, et autres
Publié: (2025)
par: Gupta, Vansh, et autres
Publié: (2025)
How do Large Language Models Handle Multilingualism?
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
par: Guo, Ping, et autres
Publié: (2025)
par: Guo, Ping, et autres
Publié: (2025)
Flaming-hot Initiation with Regular Execution Sampling for Large Language Models
par: Chen, Weizhe, et autres
Publié: (2024)
par: Chen, Weizhe, et autres
Publié: (2024)
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
par: Huang, Kaiyu, et autres
Publié: (2024)
par: Huang, Kaiyu, et autres
Publié: (2024)
Tool Calling is Linearly Readable and Steerable in Language Models
par: Wu, Zekun, et autres
Publié: (2026)
par: Wu, Zekun, et autres
Publié: (2026)
RobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy Response
par: Luo, Junyu, et autres
Publié: (2024)
par: Luo, Junyu, et autres
Publié: (2024)
Latent Preference Modeling for Cross-Session Personalized Tool Calling
par: Yoon, Yejin, et autres
Publié: (2026)
par: Yoon, Yejin, et autres
Publié: (2026)
From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges
par: Hong, Yihan, et autres
Publié: (2026)
par: Hong, Yihan, et autres
Publié: (2026)
Documents similaires
-
AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback
par: Zhang, Wanpeng, et autres
Publié: (2023) -
Dynamics of Adversarial Attacks on Large Language Model-Based Search Engines
par: Hu, Xiyang
Publié: (2025) -
SUTRA: Scalable Multilingual Language Model Architecture
par: Bendale, Abhijit, et autres
Publié: (2024) -
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
par: Huang, Xu, et autres
Publié: (2024) -
Multilingual Collaborative Defense for Large Language Models
par: Li, Hongliang, et autres
Publié: (2025)