Saved in:
| Main Authors: | Zhang, Jianyi, Ji, Xu, Zhou, Ziyin, Zhou, Yuchen, Shi, Shubo, Wu, Haoyu, Li, Zhen, Liu, Shizhao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2508.00323 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving
by: Zhang, Jianyi, et al.
Published: (2025)
by: Zhang, Jianyi, et al.
Published: (2025)
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
by: Zhang, Jianyi, et al.
Published: (2025)
by: Zhang, Jianyi, et al.
Published: (2025)
Can't say cant? Measuring and Reasoning of Dark Jargons in Large Language Models
by: Ji, Xu, et al.
Published: (2024)
by: Ji, Xu, et al.
Published: (2024)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
by: Feng, Yichen, et al.
Published: (2025)
by: Feng, Yichen, et al.
Published: (2025)
Visually Descriptive Language Model for Vector Graphics Reasoning
by: Wang, Zhenhailong, et al.
Published: (2024)
by: Wang, Zhenhailong, et al.
Published: (2024)
DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation
by: Liu, Ziyuan, et al.
Published: (2026)
by: Liu, Ziyuan, et al.
Published: (2026)
Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations
by: Zhou, Ziyin, et al.
Published: (2026)
by: Zhou, Ziyin, et al.
Published: (2026)
GraphicBench: A Planning Benchmark for Graphic Design with Language Agents
by: Ki, Dayeon, et al.
Published: (2025)
by: Ki, Dayeon, et al.
Published: (2025)
Remove Symmetries to Control Model Expressivity and Improve Optimization
by: Ziyin, Liu, et al.
Published: (2024)
by: Ziyin, Liu, et al.
Published: (2024)
Improving Retrieval Augmented Language Model with Self-Reasoning
by: Xia, Yuan, et al.
Published: (2024)
by: Xia, Yuan, et al.
Published: (2024)
Formula-R1: Incentivizing LLM Reasoning over Complex Tables with Numerical Computation via Formula-Driven Reinforcement Learning
by: Cao, Lang, et al.
Published: (2025)
by: Cao, Lang, et al.
Published: (2025)
WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models
by: Yin, Qiyue, et al.
Published: (2025)
by: Yin, Qiyue, et al.
Published: (2025)
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
by: Liu, Yihao, et al.
Published: (2025)
by: Liu, Yihao, et al.
Published: (2025)
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
by: Chen, Yuyan, et al.
Published: (2024)
by: Chen, Yuyan, et al.
Published: (2024)
Self-supervised Hierarchical Visual Reasoning with World Model
by: Xu, Yuanfei, et al.
Published: (2026)
by: Xu, Yuanfei, et al.
Published: (2026)
Three Mechanisms of Feature Learning in a Linear Network
by: Xu, Yizhou, et al.
Published: (2024)
by: Xu, Yizhou, et al.
Published: (2024)
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
by: Xue, Siqiao, et al.
Published: (2026)
by: Xue, Siqiao, et al.
Published: (2026)
EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records
by: Shi, Wenqi, et al.
Published: (2024)
by: Shi, Wenqi, et al.
Published: (2024)
Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
by: Jiang, Jin, et al.
Published: (2025)
by: Jiang, Jin, et al.
Published: (2025)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
by: Xu, Xin, et al.
Published: (2025)
by: Xu, Xin, et al.
Published: (2025)
CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning
by: Chen, Shuxu, et al.
Published: (2026)
by: Chen, Shuxu, et al.
Published: (2026)
GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding
by: Zhang, Ziyin, et al.
Published: (2024)
by: Zhang, Ziyin, et al.
Published: (2024)
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
by: Tie, Guiyao, et al.
Published: (2025)
by: Tie, Guiyao, et al.
Published: (2025)
CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models
by: Komanduri, Aneesh, et al.
Published: (2025)
by: Komanduri, Aneesh, et al.
Published: (2025)
Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
by: Gong, Haozhen, et al.
Published: (2025)
by: Gong, Haozhen, et al.
Published: (2025)
An Enhanced Prompt-Based LLM Reasoning Scheme via Knowledge Graph-Integrated Collaboration
by: Li, Yihao, et al.
Published: (2024)
by: Li, Yihao, et al.
Published: (2024)
GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
by: Yuan, Zike, et al.
Published: (2024)
by: Yuan, Zike, et al.
Published: (2024)
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization
by: Liu, Jiacai, et al.
Published: (2024)
by: Liu, Jiacai, et al.
Published: (2024)
StealthDiffusion: Towards Evading Diffusion Forensic Detection through Diffusion Model
by: Zhou, Ziyin, et al.
Published: (2024)
by: Zhou, Ziyin, et al.
Published: (2024)
On The Fragility of Benchmark Contamination Detection in Reasoning Models
by: Wang, Han, et al.
Published: (2025)
by: Wang, Han, et al.
Published: (2025)
SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
by: Miao, Zhongjian, et al.
Published: (2025)
by: Miao, Zhongjian, et al.
Published: (2025)
Benchmarking Reasoning Robustness in Large Language Models
by: Yu, Tong, et al.
Published: (2025)
by: Yu, Tong, et al.
Published: (2025)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
by: Tong, Haoyu, et al.
Published: (2026)
by: Tong, Haoyu, et al.
Published: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
by: Jiang, Fengqing, et al.
Published: (2025)
by: Jiang, Fengqing, et al.
Published: (2025)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
by: Fan, Mingyuan, et al.
Published: (2026)
by: Fan, Mingyuan, et al.
Published: (2026)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
by: Shi, Wenqi, et al.
Published: (2024)
by: Shi, Wenqi, et al.
Published: (2024)
Vision-Language Models Can Self-Improve Reasoning via Reflection
by: Cheng, Kanzhi, et al.
Published: (2024)
by: Cheng, Kanzhi, et al.
Published: (2024)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
by: Chen, Xiaoshu, et al.
Published: (2026)
by: Chen, Xiaoshu, et al.
Published: (2026)
Sparse Visual Thought Circuits in Vision-Language Models
by: Zhou, Yunpeng
Published: (2026)
by: Zhou, Yunpeng
Published: (2026)
Similar Items
-
CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving
by: Zhang, Jianyi, et al.
Published: (2025) -
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
by: Zhang, Jianyi, et al.
Published: (2025) -
Can't say cant? Measuring and Reasoning of Dark Jargons in Large Language Models
by: Ji, Xu, et al.
Published: (2024) -
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
by: Feng, Yichen, et al.
Published: (2025) -
Visually Descriptive Language Model for Vector Graphics Reasoning
by: Wang, Zhenhailong, et al.
Published: (2024)