Generative Evaluation of Complex Reasoning in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Haowei, Wang, Xiangyu, Yan, Ruilin, Huang, Baizhou, Ye, Haotian, Zhu, Jianhua, Wang, Zihao, Zou, James, Ma, Jianzhu, Liang, Yitao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
par: Lin, Haowei, et autres
Publié: (2024)
par: Lin, Haowei, et autres
Publié: (2024)
Inference-time Scaling of Diffusion Models through Classical Search
par: Zhang, Xiangcheng, et autres
Publié: (2025)
par: Zhang, Xiangcheng, et autres
Publié: (2025)
Can Language Models Discover Scaling Laws?
par: Lin, Haowei, et autres
Publié: (2025)
par: Lin, Haowei, et autres
Publié: (2025)
TFG-Flow: Training-free Guidance in Multimodal Generative Flow
par: Lin, Haowei, et autres
Publié: (2025)
par: Lin, Haowei, et autres
Publié: (2025)
CLoG: Benchmarking Continual Learning of Image Generation Models
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
TFG: Unified Training-Free Guidance for Diffusion Models
par: Ye, Haotian, et autres
Publié: (2024)
par: Ye, Haotian, et autres
Publié: (2024)
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
par: Zheng, Xinyue, et autres
Publié: (2023)
par: Zheng, Xinyue, et autres
Publié: (2023)
UniCode: Augmenting Evaluation for Code Reasoning
par: Zheng, Xinyue, et autres
Publié: (2025)
par: Zheng, Xinyue, et autres
Publié: (2025)
Efficient and Asymptotically Unbiased Constrained Decoding for Large Language Models
par: Ye, Haotian, et autres
Publié: (2025)
par: Ye, Haotian, et autres
Publié: (2025)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
par: Li, Muyao, et autres
Publié: (2025)
par: Li, Muyao, et autres
Publié: (2025)
GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents
par: Cai, Shaofei, et autres
Publié: (2024)
par: Cai, Shaofei, et autres
Publié: (2024)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
par: Jiang, Jin, et autres
Publié: (2025)
par: Jiang, Jin, et autres
Publié: (2025)
Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents
par: Wang, Zihao, et autres
Publié: (2023)
par: Wang, Zihao, et autres
Publié: (2023)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
par: Lin, Zicheng, et autres
Publié: (2024)
par: Lin, Zicheng, et autres
Publié: (2024)
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
par: Zhu, Junlin, et autres
Publié: (2026)
par: Zhu, Junlin, et autres
Publié: (2026)
A Neural Symbolic Model for Space Physics
par: Ying, Jie, et autres
Publié: (2025)
par: Ying, Jie, et autres
Publié: (2025)
WaterPool: A Watermark Mitigating Trade-offs among Imperceptibility, Efficacy and Robustness
par: Huang, Baizhou, et autres
Publié: (2024)
par: Huang, Baizhou, et autres
Publié: (2024)
SR-FoT: A Syllogistic-Reasoning Framework of Thought for Large Language Models Tackling Knowledge-based Reasoning Tasks
par: Wan, Wentao, et autres
Publié: (2025)
par: Wan, Wentao, et autres
Publié: (2025)
Peptide2Mol: A Diffusion Model for Generating Small Molecules as Peptide Mimics for Targeted Protein Binding
par: He, Xinheng, et autres
Publié: (2025)
par: He, Xinheng, et autres
Publié: (2025)
Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency
par: Huang, Baizhou, et autres
Publié: (2023)
par: Huang, Baizhou, et autres
Publié: (2023)
TableReasoner: Advancing Table Reasoning Framework with Large Language Models
par: Xiong, Sishi, et autres
Publié: (2025)
par: Xiong, Sishi, et autres
Publié: (2025)
OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
par: Wang, Zihao, et autres
Publié: (2025)
par: Wang, Zihao, et autres
Publié: (2025)
LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models
par: Hao, Shibo, et autres
Publié: (2024)
par: Hao, Shibo, et autres
Publié: (2024)
Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning
par: Fu, Zichuan, et autres
Publié: (2026)
par: Fu, Zichuan, et autres
Publié: (2026)
Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models
par: Chen, Yanbing, et autres
Publié: (2024)
par: Chen, Yanbing, et autres
Publié: (2024)
Integrating Protein Dynamics into Structure-Based Drug Design via Full-Atom Stochastic Flows
par: Zhou, Xiangxin, et autres
Publié: (2025)
par: Zhou, Xiangxin, et autres
Publié: (2025)
MeLo: Low-rank Adaptation is Better than Fine-tuning for Medical Image Diagnosis
par: Zhu, Yitao, et autres
Publié: (2023)
par: Zhu, Yitao, et autres
Publié: (2023)
On the Evaluation of Large Language Models in Unit Test Generation
par: Yang, Lin, et autres
Publié: (2024)
par: Yang, Lin, et autres
Publié: (2024)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
par: Huang, Zhijian, et autres
Publié: (2024)
par: Huang, Zhijian, et autres
Publié: (2024)
Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
par: Shen, Huanming, et autres
Publié: (2025)
par: Shen, Huanming, et autres
Publié: (2025)
$B^4$: A Black-Box Scrubbing Attack on LLM Watermarks
par: Huang, Baizhou, et autres
Publié: (2024)
par: Huang, Baizhou, et autres
Publié: (2024)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
par: Huang, Junquan, et autres
Publié: (2025)
par: Huang, Junquan, et autres
Publié: (2025)
Reducing Hallucinations in Vision-Language Models via Latent Space Steering
par: Liu, Sheng, et autres
Publié: (2024)
par: Liu, Sheng, et autres
Publié: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
par: Zhu, Qin, et autres
Publié: (2025)
par: Zhu, Qin, et autres
Publié: (2025)
Evaluating Large Language Models with Psychometrics
par: Li, Yuan, et autres
Publié: (2024)
par: Li, Yuan, et autres
Publié: (2024)
On the Limitations and Capabilities of Position Embeddings for Length Generalization
par: Chen, Yang, et autres
Publié: (2025)
par: Chen, Yang, et autres
Publié: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
Several New Generalizations of LYM Inequality
par: Huang, Zihao, et autres
Publié: (2025)
par: Huang, Zihao, et autres
Publié: (2025)
Documents similaires
-
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
par: Lin, Haowei, et autres
Publié: (2024) -
Inference-time Scaling of Diffusion Models through Classical Search
par: Zhang, Xiangcheng, et autres
Publié: (2025) -
Can Language Models Discover Scaling Laws?
par: Lin, Haowei, et autres
Publié: (2025) -
TFG-Flow: Training-free Guidance in Multimodal Generative Flow
par: Lin, Haowei, et autres
Publié: (2025) -
CLoG: Benchmarking Continual Learning of Image Generation Models
par: Zhang, Haotian, et autres
Publié: (2024)