Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yue, Chen, MingKang, Liu, Qihua, Hu, Mengkang, Chen, Qiguang, Zhang, Gengrui, Hu, Shuyue, Zhai, Guangtao, Qiao, Yu, Wang, Yu, Shao, Wenqi, Luo, Ping |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
by: Hu, Mengkang, et al.
Published: (2024)
by: Hu, Mengkang, et al.
Published: (2024)
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
by: Hu, Mengkang, et al.
Published: (2023)
by: Hu, Mengkang, et al.
Published: (2023)
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
by: Hu, Mengkang, et al.
Published: (2025)
by: Hu, Mengkang, et al.
Published: (2025)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
by: Wang, Peng, et al.
Published: (2025)
by: Wang, Peng, et al.
Published: (2025)
Large Language Models are Near-Optimal Decision-Makers with a Non-Human Learning Behavior
by: Li, Hao, et al.
Published: (2025)
by: Li, Hao, et al.
Published: (2025)
OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents
by: Zhou, Yuhang, et al.
Published: (2026)
by: Zhou, Yuhang, et al.
Published: (2026)
Learning Compact Representations of LLM Abilities via Item Response Theory
by: Chen, Jianhao, et al.
Published: (2025)
by: Chen, Jianhao, et al.
Published: (2025)
Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models
by: Chen, Qiguang, et al.
Published: (2025)
by: Chen, Qiguang, et al.
Published: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
by: Hu, Yutao, et al.
Published: (2024)
by: Hu, Yutao, et al.
Published: (2024)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
by: Chen, Junting, et al.
Published: (2025)
by: Chen, Junting, et al.
Published: (2025)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
by: Chen, Junting, et al.
Published: (2024)
by: Chen, Junting, et al.
Published: (2024)
Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
by: Hu, Mengkang, et al.
Published: (2025)
by: Hu, Mengkang, et al.
Published: (2025)
KET-QA: A Dataset for Knowledge Enhanced Table Question Answering
by: Hu, Mengkang, et al.
Published: (2024)
by: Hu, Mengkang, et al.
Published: (2024)
Electronic Circuit Principles of Large Language Models
by: Chen, Qiguang, et al.
Published: (2025)
by: Chen, Qiguang, et al.
Published: (2025)
Do We Truly Need So Many Samples? Multi-LLM Repeated Sampling Efficiently Scales Test-Time Compute
by: Chen, Jianhao, et al.
Published: (2025)
by: Chen, Jianhao, et al.
Published: (2025)
Relevant or Random: Can LLMs Truly Perform Analogical Reasoning?
by: Qin, Chengwei, et al.
Published: (2024)
by: Qin, Chengwei, et al.
Published: (2024)
Community Detection and Network Reconstruction With Dependent Connectivity From Rich but Noisy Network Data
by: Shuyue Jin, et al.
Published: (2025)
by: Shuyue Jin, et al.
Published: (2025)
AnalogCoder-Pro: Unifying Analog Circuit Generation and Optimization via Multi-modal LLMs
by: Lai, Yao, et al.
Published: (2025)
by: Lai, Yao, et al.
Published: (2025)
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
by: Mu, Yao, et al.
Published: (2024)
by: Mu, Yao, et al.
Published: (2024)
Position: Towards Implicit Prompt For Text-To-Image Models
by: Yang, Yue, et al.
Published: (2024)
by: Yang, Yue, et al.
Published: (2024)
A New Geometric Representation for 3D Bijective Mappings and Applications
by: Chen, Qiguang, et al.
Published: (2023)
by: Chen, Qiguang, et al.
Published: (2023)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
by: Zhao, Lirui, et al.
Published: (2024)
by: Zhao, Lirui, et al.
Published: (2024)
Needle In A Multimodal Haystack
by: Wang, Weiyun, et al.
Published: (2024)
by: Wang, Weiyun, et al.
Published: (2024)
AnalogCoder: Analog Circuit Design via Training-Free Code Generation
by: Lai, Yao, et al.
Published: (2024)
by: Lai, Yao, et al.
Published: (2024)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
by: Meng, Fanqing, et al.
Published: (2024)
by: Meng, Fanqing, et al.
Published: (2024)
The Universal Landscape of Human Reasoning
by: Chen, Qiguang, et al.
Published: (2025)
by: Chen, Qiguang, et al.
Published: (2025)
Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence
by: Hu, Shuyue, et al.
Published: (2025)
by: Hu, Shuyue, et al.
Published: (2025)
Gravitational Lensing of Euler-Heisenberg Black Hole Surrounded by Perfect Fluid Dark Matter
by: Su, Ping, et al.
Published: (2024)
by: Su, Ping, et al.
Published: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
by: Xu, Peng, et al.
Published: (2024)
by: Xu, Peng, et al.
Published: (2024)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
by: Meng, Fanqing, et al.
Published: (2024)
by: Meng, Fanqing, et al.
Published: (2024)
Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation
by: Cui, Zhiyao, et al.
Published: (2026)
by: Cui, Zhiyao, et al.
Published: (2026)
AI4Research: A Survey of Artificial Intelligence for Scientific Research
by: Chen, Qiguang, et al.
Published: (2025)
by: Chen, Qiguang, et al.
Published: (2025)
WOC: Dual-Path Weighted Object Consensus Made Efficient
by: Fonseca, Tanisha, et al.
Published: (2025)
by: Fonseca, Tanisha, et al.
Published: (2025)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
by: Yang, Yue, et al.
Published: (2024)
by: Yang, Yue, et al.
Published: (2024)
Learning local equivariant representations for quantum operators
by: Zhouyin, Zhanghao, et al.
Published: (2024)
by: Zhouyin, Zhanghao, et al.
Published: (2024)
Efficient Semantic-aware Encryption for Secure Communications in Intelligent Connected Vehicles
by: Wang, Bizhu, et al.
Published: (2025)
by: Wang, Bizhu, et al.
Published: (2025)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
Chronic Kidney Disease and Glaucoma: Is the Case Truly Closed?
by: Alan Y. Hsu, et al.
Published: (2025)
by: Alan Y. Hsu, et al.
Published: (2025)
Deformation-Invariant Neural Network and Its Applications in Distorted Image Restoration and Analysis
by: Zhang, Han, et al.
Published: (2023)
by: Zhang, Han, et al.
Published: (2023)
ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving
by: Wu, Haoyuan, et al.
Published: (2025)
by: Wu, Haoyuan, et al.
Published: (2025)
Similar Items
-
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
by: Hu, Mengkang, et al.
Published: (2024) -
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
by: Hu, Mengkang, et al.
Published: (2023) -
Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
by: Hu, Mengkang, et al.
Published: (2025) -
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
by: Wang, Peng, et al.
Published: (2025) -
Large Language Models are Near-Optimal Decision-Makers with a Non-Human Learning Behavior
by: Li, Hao, et al.
Published: (2025)