EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Junquan, Wu, Haotian, Gao, Yubo, Yan, Yibo, Zhang, Junyan, Hei, Yonghua, Dai, Song, Zhang, Jie, Tan, Puay Siew, Hu, Xuming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs
por: Gao, Yubo, et al.
Publicado: (2026)
por: Gao, Yubo, et al.
Publicado: (2026)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
por: Dai, Song, et al.
Publicado: (2025)
por: Dai, Song, et al.
Publicado: (2025)
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
por: Zhang, Junyan, et al.
Publicado: (2025)
por: Zhang, Junyan, et al.
Publicado: (2025)
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
por: Huang, Dong, et al.
Publicado: (2024)
por: Huang, Dong, et al.
Publicado: (2024)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
por: Tao, Sicheng, et al.
Publicado: (2025)
por: Tao, Sicheng, et al.
Publicado: (2025)
Unlocking Speech Instruction Data Potential with Query Rewriting
por: Hei, Yonghua, et al.
Publicado: (2025)
por: Hei, Yonghua, et al.
Publicado: (2025)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
por: Xun, Shuhang, et al.
Publicado: (2025)
por: Xun, Shuhang, et al.
Publicado: (2025)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
por: Zhang, Jianghangfan, et al.
Publicado: (2025)
por: Zhang, Jianghangfan, et al.
Publicado: (2025)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
por: Wang, Yaoning, et al.
Publicado: (2025)
por: Wang, Yaoning, et al.
Publicado: (2025)
EffiReasonTrans: RL-Optimized Reasoning for Code Translation
por: Wang, Yanlin, et al.
Publicado: (2025)
por: Wang, Yanlin, et al.
Publicado: (2025)
Do BERT-Like Bidirectional Models Still Perform Better on Text Classification in the Era of LLMs?
por: Zhang, Junyan, et al.
Publicado: (2025)
por: Zhang, Junyan, et al.
Publicado: (2025)
EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code
por: Qing, Yuhao, et al.
Publicado: (2025)
por: Qing, Yuhao, et al.
Publicado: (2025)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
por: He, Ziyi, et al.
Publicado: (2026)
por: He, Ziyi, et al.
Publicado: (2026)
V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
por: Luo, Yang, et al.
Publicado: (2025)
por: Luo, Yang, et al.
Publicado: (2025)
EffiVED:Efficient Video Editing via Text-instruction Diffusion Models
por: Zhang, Zhenghao, et al.
Publicado: (2024)
por: Zhang, Zhenghao, et al.
Publicado: (2024)
Efficient Annotator Reliability Assessment with EffiARA
por: Cook, Owen, et al.
Publicado: (2025)
por: Cook, Owen, et al.
Publicado: (2025)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
por: Li, Xuzhao, et al.
Publicado: (2025)
por: Li, Xuzhao, et al.
Publicado: (2025)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
por: Qin, Jialong, et al.
Publicado: (2025)
por: Qin, Jialong, et al.
Publicado: (2025)
EffiPerception: an Efficient Framework for Various Perception Tasks
por: Xiang, Xinhao, et al.
Publicado: (2024)
por: Xiang, Xinhao, et al.
Publicado: (2024)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
por: Dai, Yang, et al.
Publicado: (2026)
por: Dai, Yang, et al.
Publicado: (2026)
DNR Bench: Benchmarking Over-Reasoning in Reasoning LLMs
por: Hashemi, Masoud, et al.
Publicado: (2025)
por: Hashemi, Masoud, et al.
Publicado: (2025)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
por: Chao, Jianghan, et al.
Publicado: (2025)
por: Chao, Jianghan, et al.
Publicado: (2025)
CoheMark: A Novel Sentence-Level Watermark for Enhanced Text Quality
por: Zhang, Junyan, et al.
Publicado: (2025)
por: Zhang, Junyan, et al.
Publicado: (2025)
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
por: Han, Feng, et al.
Publicado: (2025)
por: Han, Feng, et al.
Publicado: (2025)
LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning
por: Xu, Haiying, et al.
Publicado: (2026)
por: Xu, Haiying, et al.
Publicado: (2026)
PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning
por: Dip, Sajib Acharjee, et al.
Publicado: (2026)
por: Dip, Sajib Acharjee, et al.
Publicado: (2026)
FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning
por: Shen, Xu, et al.
Publicado: (2025)
por: Shen, Xu, et al.
Publicado: (2025)
($\boldsymbolθ_l, \boldsymbolθ_u$)-Parametric Multi-Task Optimization: Joint Search in Solution and Infinite Task Spaces
por: Wei, Tingyang, et al.
Publicado: (2025)
por: Wei, Tingyang, et al.
Publicado: (2025)
The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
por: Zhang, Ruichen, et al.
Publicado: (2025)
por: Zhang, Ruichen, et al.
Publicado: (2025)
DeonticBench: A Benchmark for Reasoning over Rules
por: Dou, Guangyao, et al.
Publicado: (2026)
por: Dou, Guangyao, et al.
Publicado: (2026)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
por: Wen, Bin, et al.
Publicado: (2025)
por: Wen, Bin, et al.
Publicado: (2025)
EffiLearner: Enhancing Efficiency of Generated Code via Self-Optimization
por: Huang, Dong, et al.
Publicado: (2024)
por: Huang, Dong, et al.
Publicado: (2024)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
por: Hu, Lanxiang, et al.
Publicado: (2025)
por: Hu, Lanxiang, et al.
Publicado: (2025)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
por: Yang, Siwei, et al.
Publicado: (2024)
por: Yang, Siwei, et al.
Publicado: (2024)
DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
por: Jin, Song, et al.
Publicado: (2026)
por: Jin, Song, et al.
Publicado: (2026)
XFinBench: Benchmarking LLMs in Complex Financial Problem Solving and Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2025)
por: Zhang, Zhihan, et al.
Publicado: (2025)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
por: Gao, Zihan, et al.
Publicado: (2025)
por: Gao, Zihan, et al.
Publicado: (2025)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
por: Wang, Andong, et al.
Publicado: (2024)
por: Wang, Andong, et al.
Publicado: (2024)
R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation
por: Guo, Meng-Hao, et al.
Publicado: (2025)
por: Guo, Meng-Hao, et al.
Publicado: (2025)
Ejemplares similares
-
Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs
por: Gao, Yubo, et al.
Publicado: (2026) -
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
por: Dai, Song, et al.
Publicado: (2025) -
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
por: Zhang, Junyan, et al.
Publicado: (2025) -
EffiBench: Benchmarking the Efficiency of Automatically Generated Code
por: Huang, Dong, et al.
Publicado: (2024) -
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
por: Tao, Sicheng, et al.
Publicado: (2025)