StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Following
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Jinnan, Li, Jinzhe, Wang, Yue, Chang, Yi, Wu, Yuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
von: Wang, Sizhe, et al.
Veröffentlicht: (2025)
von: Wang, Sizhe, et al.
Veröffentlicht: (2025)
Struct-Bench: A Benchmark for Differentially Private Structured Text Generation
von: Wang, Shuaiqi, et al.
Veröffentlicht: (2025)
von: Wang, Shuaiqi, et al.
Veröffentlicht: (2025)
On the Multi-turn Instruction Following for Conversational Web Agents
von: Deng, Yang, et al.
Veröffentlicht: (2024)
von: Deng, Yang, et al.
Veröffentlicht: (2024)
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
von: Li, Jinzhe, et al.
Veröffentlicht: (2025)
von: Li, Jinzhe, et al.
Veröffentlicht: (2025)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
von: Dong, Xuan, et al.
Veröffentlicht: (2026)
von: Dong, Xuan, et al.
Veröffentlicht: (2026)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
von: Wen, Bosi, et al.
Veröffentlicht: (2026)
von: Wen, Bosi, et al.
Veröffentlicht: (2026)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
von: LI, Yizhi, et al.
Veröffentlicht: (2024)
von: LI, Yizhi, et al.
Veröffentlicht: (2024)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
von: Xiao, Ruixuan, et al.
Veröffentlicht: (2024)
von: Xiao, Ruixuan, et al.
Veröffentlicht: (2024)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023)
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023)
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
von: Fan, Zhiting, et al.
Veröffentlicht: (2024)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
von: He, Yun, et al.
Veröffentlicht: (2024)
von: He, Yun, et al.
Veröffentlicht: (2024)
MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following
von: Lee, Jaeyun, et al.
Veröffentlicht: (2026)
von: Lee, Jaeyun, et al.
Veröffentlicht: (2026)
StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
von: Yang, Jialin, et al.
Veröffentlicht: (2025)
von: Yang, Jialin, et al.
Veröffentlicht: (2025)
TOD-ProcBench: Benchmarking Complex Instruction-Following in Task-Oriented Dialogues
von: Ghazarian, Sarik, et al.
Veröffentlicht: (2025)
von: Ghazarian, Sarik, et al.
Veröffentlicht: (2025)
THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
Data Selection for Multi-turn Dialogue Instruction Tuning
von: Li, Bo, et al.
Veröffentlicht: (2026)
von: Li, Bo, et al.
Veröffentlicht: (2026)
StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs
von: Chen, Hailin, et al.
Veröffentlicht: (2024)
von: Chen, Hailin, et al.
Veröffentlicht: (2024)
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
von: Zeng, Bo, et al.
Veröffentlicht: (2025)
von: Zeng, Bo, et al.
Veröffentlicht: (2025)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
von: Yan, Jianhao, et al.
Veröffentlicht: (2024)
von: Yan, Jianhao, et al.
Veröffentlicht: (2024)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2025)
von: Zhu, Xiangyang, et al.
Veröffentlicht: (2025)
TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild
von: Li, Huayang, et al.
Veröffentlicht: (2023)
von: Li, Huayang, et al.
Veröffentlicht: (2023)
MARS-Bench: A Multi-turn Athletic Real-world Scenario Benchmark for Dialogue Evaluation
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
von: Yang, Chenghao, et al.
Veröffentlicht: (2025)
DreamStruct: Understanding Slides and User Interfaces via Synthetic Data Generation
von: Peng, Yi-Hao, et al.
Veröffentlicht: (2024)
von: Peng, Yi-Hao, et al.
Veröffentlicht: (2024)
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
von: Ding, Deming, et al.
Veröffentlicht: (2026)
von: Ding, Deming, et al.
Veröffentlicht: (2026)
FollowTable: A Benchmark for Instruction-Following Table Retrieval
von: Jin, Rihui, et al.
Veröffentlicht: (2026)
von: Jin, Rihui, et al.
Veröffentlicht: (2026)
Struct-X: Enhancing Large Language Models Reasoning with Structured Data
von: Tan, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Tan, Xiaoyu, et al.
Veröffentlicht: (2024)
ProtStructQA: A Denotation Threshold in Protein Structural Reasoning
von: Mandiga, Aravind, et al.
Veröffentlicht: (2026)
von: Mandiga, Aravind, et al.
Veröffentlicht: (2026)
StructLM: Towards Building Generalist Models for Structured Knowledge Grounding
von: Zhuang, Alex, et al.
Veröffentlicht: (2024)
von: Zhuang, Alex, et al.
Veröffentlicht: (2024)
EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models
von: Zou, Tao, et al.
Veröffentlicht: (2025)
von: Zou, Tao, et al.
Veröffentlicht: (2025)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
von: Chen, Mingyang, et al.
Veröffentlicht: (2024)
von: Chen, Mingyang, et al.
Veröffentlicht: (2024)
Benchmarking Complex Instruction-Following with Multiple Constraints Composition
von: Wen, Bosi, et al.
Veröffentlicht: (2024)
von: Wen, Bosi, et al.
Veröffentlicht: (2024)
RefuteBench 2.0 -- Agentic Benchmark for Dynamic Evaluation of LLM Responses to Refutation Instruction
von: Yan, Jianhao, et al.
Veröffentlicht: (2025)
von: Yan, Jianhao, et al.
Veröffentlicht: (2025)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2025)
von: Jiang, Zhuohang, et al.
Veröffentlicht: (2025)
AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
von: He, Yun, et al.
Veröffentlicht: (2025)
von: He, Yun, et al.
Veröffentlicht: (2025)
MMMT-IF: A Challenging Multimodal Multi-Turn Instruction Following Benchmark
von: Epstein, Elliot L., et al.
Veröffentlicht: (2024)
von: Epstein, Elliot L., et al.
Veröffentlicht: (2024)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
von: Li, Yuan, et al.
Veröffentlicht: (2024)
von: Li, Yuan, et al.
Veröffentlicht: (2024)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2025)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
von: Qin, Yiwei, et al.
Veröffentlicht: (2024)
von: Qin, Yiwei, et al.
Veröffentlicht: (2024)
ProcBench: Benchmark for Multi-Step Reasoning and Following Procedure
von: Fujisawa, Ippei, et al.
Veröffentlicht: (2024)
von: Fujisawa, Ippei, et al.
Veröffentlicht: (2024)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
von: Yang, Sihan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
von: Wang, Sizhe, et al.
Veröffentlicht: (2025) -
Struct-Bench: A Benchmark for Differentially Private Structured Text Generation
von: Wang, Shuaiqi, et al.
Veröffentlicht: (2025) -
On the Multi-turn Instruction Following for Conversational Web Agents
von: Deng, Yang, et al.
Veröffentlicht: (2024) -
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
von: Li, Jinzhe, et al.
Veröffentlicht: (2025) -
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
von: Dong, Xuan, et al.
Veröffentlicht: (2026)