StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Jialin, Jiang, Dongfu, He, Lipeng, Siu, Sherman, Zhang, Yuxuan, Liao, Disen, Li, Zhuofeng, Zeng, Huaye, Jia, Yiming, Wang, Haozhe, Schneider, Benjamin, Ruan, Chi, Ma, Wentao, Lyu, Zhiheng, Wang, Yifei, Lu, Yi, Do, Quy Duc, Jiang, Ziyan, Nie, Ping, Chen, Wenhu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ACECODER: Acing Coder RL via Automated Test-Case Synthesis
by: Zeng, Huaye, et al.
Published: (2025)
by: Zeng, Huaye, et al.
Published: (2025)
EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning
by: Ruan, Chi, et al.
Published: (2026)
by: Ruan, Chi, et al.
Published: (2026)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
by: Cao, Boxi, et al.
Published: (2024)
by: Cao, Boxi, et al.
Published: (2024)
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
by: Ruan, Chi, et al.
Published: (2025)
by: Ruan, Chi, et al.
Published: (2025)
VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation
by: He, Xuan, et al.
Published: (2024)
by: He, Xuan, et al.
Published: (2024)
MANTIS: Interleaved Multi-Image Instruction Tuning
by: Jiang, Dongfu, et al.
Published: (2024)
by: Jiang, Dongfu, et al.
Published: (2024)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
by: Jiang, Dongfu, et al.
Published: (2025)
by: Jiang, Dongfu, et al.
Published: (2025)
VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation
by: Ma, Wentao, et al.
Published: (2025)
by: Ma, Wentao, et al.
Published: (2025)
Long-context LLMs Struggle with Long In-context Learning
by: Li, Tianle, et al.
Published: (2024)
by: Li, Tianle, et al.
Published: (2024)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
by: Chen, Jiacheng, et al.
Published: (2024)
by: Chen, Jiacheng, et al.
Published: (2024)
VideoScore2: Think before You Score in Generative Video Evaluation
by: He, Xuan, et al.
Published: (2025)
by: He, Xuan, et al.
Published: (2025)
LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs
by: Jiang, Ziyan, et al.
Published: (2024)
by: Jiang, Ziyan, et al.
Published: (2024)
QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
by: Schneider, Benjamin, et al.
Published: (2025)
by: Schneider, Benjamin, et al.
Published: (2025)
VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation
by: Ku, Max, et al.
Published: (2023)
by: Ku, Max, et al.
Published: (2023)
OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
by: Li, Zhuofeng, et al.
Published: (2026)
by: Li, Zhuofeng, et al.
Published: (2026)
General-Reasoner: Advancing LLM Reasoning Across All Domains
by: Ma, Xueguang, et al.
Published: (2025)
by: Ma, Xueguang, et al.
Published: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
by: Lu, Yujie, et al.
Published: (2024)
by: Lu, Yujie, et al.
Published: (2024)
TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks
by: Jiang, Dongfu, et al.
Published: (2023)
by: Jiang, Dongfu, et al.
Published: (2023)
The economics of consanguineous marriages / Quy-Toan Do, Sirya Iyer, Shareen Joshi
by: Do, Quy-Toan
Published: (2006)
by: Do, Quy-Toan
Published: (2006)
Trade, inequality, and the political economy of institutions / Quy-Toan Do, Andrei A. Levchenko
by: Do, Quy-Toan
Published: (2006)
by: Do, Quy-Toan
Published: (2006)
Comparative advantage, demand for external finance, and financial development / Quy-Toan Do, Andrei A. Levchenko
by: Do, Quy-Toan
Published: (2006)
by: Do, Quy-Toan
Published: (2006)
Land rights and economic development : evidence from Vietnam / Quy-Toan Do, Lakshmi Iyer
by: Do, Quy-Toan
Published: (2003)
by: Do, Quy-Toan
Published: (2003)
Poverty, social divisions, and conflict in Nepal / Quy-Toan Do, Lakshmi Iyer
by: Do, Quy-Toan
Published: (2007)
by: Do, Quy-Toan
Published: (2007)
Supersticion, family planning, and human development / Quy-Toan Do, Tung Duc Phung
by: Do, Quy-Toan
Published: (2006)
by: Do, Quy-Toan
Published: (2006)
Institutional Trap / Quy-Toan Do
by: Do, Quy-Toan
Published: (2004)
by: Do, Quy-Toan
Published: (2004)
Trade and financial development / Quy-Toan Do, Andrei A. Levchenko
by: Do, Quy-Toan
Published: (2004)
by: Do, Quy-Toan
Published: (2004)
ScholarCopilot: Training Large Language Models for Academic Writing with Accurate Citations
by: Wang, Yubo, et al.
Published: (2025)
by: Wang, Yubo, et al.
Published: (2025)
GenAI Arena: An Open Evaluation Platform for Generative Models
by: Jiang, Dongfu, et al.
Published: (2024)
by: Jiang, Dongfu, et al.
Published: (2024)
UniMaia: Steering Chess Policies with Language for Human-like Play
by: Siu, Sherman, et al.
Published: (2026)
by: Siu, Sherman, et al.
Published: (2026)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
by: Wang, Yaoning, et al.
Published: (2025)
by: Wang, Yaoning, et al.
Published: (2025)
PixelWorld: How Far Are We from Perceiving Everything as Pixels?
by: Lyu, Zhiheng, et al.
Published: (2025)
by: Lyu, Zhiheng, et al.
Published: (2025)
StructLM: Towards Building Generalist Models for Structured Knowledge Grounding
by: Zhuang, Alex, et al.
Published: (2024)
by: Zhuang, Alex, et al.
Published: (2024)
ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents
by: Li, Zhuofeng, et al.
Published: (2026)
by: Li, Zhuofeng, et al.
Published: (2026)
StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues
by: Ruan, Zanxi, et al.
Published: (2026)
by: Ruan, Zanxi, et al.
Published: (2026)
StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs
by: Chen, Hailin, et al.
Published: (2024)
by: Chen, Hailin, et al.
Published: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
by: Kwan, Wai-Chung, et al.
Published: (2024)
by: Kwan, Wai-Chung, et al.
Published: (2024)
TabStruct: Measuring Structural Fidelity of Tabular Data
by: Jiang, Xiangjian, et al.
Published: (2025)
by: Jiang, Xiangjian, et al.
Published: (2025)
How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them
by: Liao, Disen, et al.
Published: (2026)
by: Liao, Disen, et al.
Published: (2026)
Semi-Supervised Reward Modeling via Iterative Self-Training
by: He, Yifei, et al.
Published: (2024)
by: He, Yifei, et al.
Published: (2024)
HiStruct+: Improving Extractive Text Summarization with Hierarchical Structure Information
by: Ruan, Qian, et al.
Published: (2022)
by: Ruan, Qian, et al.
Published: (2022)
Similar Items
-
ACECODER: Acing Coder RL via Automated Test-Case Synthesis
by: Zeng, Huaye, et al.
Published: (2025) -
EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learning
by: Ruan, Chi, et al.
Published: (2026) -
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
by: Cao, Boxi, et al.
Published: (2024) -
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
by: Ruan, Chi, et al.
Published: (2025) -
VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation
by: He, Xuan, et al.
Published: (2024)