ComplexFuncBench: Exploring Multi-Step and Constrained Function Calling under Long-Context Scenario
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhong, Lucen, Du, Zhengxiao, Zhang, Xiaohan, Hu, Haiyi, Tang, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
por: Bai, Yushi, et al.
Publicado: (2023)
por: Bai, Yushi, et al.
Publicado: (2023)
GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
por: Xu, Hao-Xiang, et al.
Publicado: (2026)
por: Xu, Hao-Xiang, et al.
Publicado: (2026)
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
por: Wang, Jun, et al.
Publicado: (2024)
por: Wang, Jun, et al.
Publicado: (2024)
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
por: Zhuo, Terry Yue, et al.
Publicado: (2024)
por: Zhuo, Terry Yue, et al.
Publicado: (2024)
Understanding Emergent Abilities of Language Models from the Loss Perspective
por: Du, Zhengxiao, et al.
Publicado: (2024)
por: Du, Zhengxiao, et al.
Publicado: (2024)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
por: Wu, Yuhao, et al.
Publicado: (2024)
por: Wu, Yuhao, et al.
Publicado: (2024)
MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models
por: Huang, Zhongzhan, et al.
Publicado: (2025)
por: Huang, Zhongzhan, et al.
Publicado: (2025)
Can MLLMs Generalize to Multi-Party dialog? Exploring Multilingual Response Generation in Complex Scenarios
por: Hu, Zhongtian, et al.
Publicado: (2025)
por: Hu, Zhongtian, et al.
Publicado: (2025)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
por: Yang, Wang, et al.
Publicado: (2025)
por: Yang, Wang, et al.
Publicado: (2025)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
por: Jiang, Zhihuan, et al.
Publicado: (2024)
por: Jiang, Zhihuan, et al.
Publicado: (2024)
Adaptable and Precise: Enterprise-Scenario LLM Function-Calling Capability Training Pipeline
por: Zeng, Guancheng, et al.
Publicado: (2024)
por: Zeng, Guancheng, et al.
Publicado: (2024)
Does RLHF Scale? Exploring the Impacts From Data, Model, and Method
por: Hou, Zhenyu, et al.
Publicado: (2024)
por: Hou, Zhenyu, et al.
Publicado: (2024)
Perception Compressor: A Training-Free Prompt Compression Framework in Long Context Scenarios
por: Tang, Jiwei, et al.
Publicado: (2024)
por: Tang, Jiwei, et al.
Publicado: (2024)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
por: Chen, Ziyang, et al.
Publicado: (2026)
por: Chen, Ziyang, et al.
Publicado: (2026)
Asynchronous LLM Function Calling
por: Gim, In, et al.
Publicado: (2024)
por: Gim, In, et al.
Publicado: (2024)
ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
por: Hou, Zhenyu, et al.
Publicado: (2024)
por: Hou, Zhenyu, et al.
Publicado: (2024)
$\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens
por: Zhang, Xinrong, et al.
Publicado: (2024)
por: Zhang, Xinrong, et al.
Publicado: (2024)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
por: Yang, Lin, et al.
Publicado: (2026)
por: Yang, Lin, et al.
Publicado: (2026)
SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation
por: Jiang, Lai, et al.
Publicado: (2025)
por: Jiang, Lai, et al.
Publicado: (2025)
SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models
por: Zhang, Dan, et al.
Publicado: (2024)
por: Zhang, Dan, et al.
Publicado: (2024)
SpreadsheetBench: Towards Challenging Real World Spreadsheet Manipulation
por: Ma, Zeyao, et al.
Publicado: (2024)
por: Ma, Zeyao, et al.
Publicado: (2024)
Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMs
por: Chen, Kunfeng, et al.
Publicado: (2026)
por: Chen, Kunfeng, et al.
Publicado: (2026)
ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline
por: Xu, Yifan, et al.
Publicado: (2024)
por: Xu, Yifan, et al.
Publicado: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model
por: Yang, Zhen, et al.
Publicado: (2024)
por: Yang, Zhen, et al.
Publicado: (2024)
MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models
por: Zhang, Yunhao, et al.
Publicado: (2024)
por: Zhang, Yunhao, et al.
Publicado: (2024)
Scaling Speech-Text Pre-training with Synthetic Interleaved Data
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
por: Sun, Siqi, et al.
Publicado: (2026)
por: Sun, Siqi, et al.
Publicado: (2026)
AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts
por: Fang, Shicheng, et al.
Publicado: (2026)
por: Fang, Shicheng, et al.
Publicado: (2026)
How does Multi-Task Training Affect Transformer In-Context Capabilities? Investigations with Function Classes
por: Bhasin, Harmon, et al.
Publicado: (2024)
por: Bhasin, Harmon, et al.
Publicado: (2024)
HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling
por: Zhou, Chulun, et al.
Publicado: (2025)
por: Zhou, Chulun, et al.
Publicado: (2025)
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
por: Ni, Xuanfan, et al.
Publicado: (2024)
por: Ni, Xuanfan, et al.
Publicado: (2024)
Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling
por: Otani, Naoki, et al.
Publicado: (2026)
por: Otani, Naoki, et al.
Publicado: (2026)
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
por: Jiang, Huiqiang, et al.
Publicado: (2023)
por: Jiang, Huiqiang, et al.
Publicado: (2023)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
por: Zhang, Yiran, et al.
Publicado: (2025)
por: Zhang, Yiran, et al.
Publicado: (2025)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
por: Wang, Lanrui, et al.
Publicado: (2025)
por: Wang, Lanrui, et al.
Publicado: (2025)
LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios
por: Wu, Xiaodong, et al.
Publicado: (2024)
por: Wu, Xiaodong, et al.
Publicado: (2024)
WIKIGENBENCH: Exploring Full-length Wikipedia Generation under Real-World Scenario
por: Zhang, Jiebin, et al.
Publicado: (2024)
por: Zhang, Jiebin, et al.
Publicado: (2024)
Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective
por: Zhong, Meizhi, et al.
Publicado: (2024)
por: Zhong, Meizhi, et al.
Publicado: (2024)
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
Ejemplares similares
-
LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding
por: Bai, Yushi, et al.
Publicado: (2023) -
GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
por: Xu, Hao-Xiang, et al.
Publicado: (2026) -
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
por: Wang, Jun, et al.
Publicado: (2024) -
BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions
por: Zhuo, Terry Yue, et al.
Publicado: (2024) -
Understanding Emergent Abilities of Language Models from the Loss Perspective
por: Du, Zhengxiao, et al.
Publicado: (2024)