Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Zixin, Liu, Peng, Sheng, Rui, Li, Haobo, Tu, Jianhong, Deng, Xiaodong, Shum, Kashun, Liu, Dayiheng, Qu, Huamin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
by: Chen, Zixin, et al.
Published: (2025)
by: Chen, Zixin, et al.
Published: (2025)
Predictive Data Selection: The Data That Predicts Is the Data That Teaches
by: Shum, Kashun, et al.
Published: (2025)
by: Shum, Kashun, et al.
Published: (2025)
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
by: Hu, Xiaomeng, et al.
Published: (2026)
by: Hu, Xiaomeng, et al.
Published: (2026)
DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors
by: Sheng, Rui, et al.
Published: (2026)
by: Sheng, Rui, et al.
Published: (2026)
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
by: Liu, Zhou, et al.
Published: (2025)
by: Liu, Zhou, et al.
Published: (2025)
CoGrader: Transforming Instructors' Assessment of Project Reports through Collaborative LLM Integration
by: Chen, Zixin, et al.
Published: (2025)
by: Chen, Zixin, et al.
Published: (2025)
From Passive Consumption to Active Interaction: Exploring Interactive LLM Scaffolding to Support Learning Engagement
by: Chen, Zixin, et al.
Published: (2026)
by: Chen, Zixin, et al.
Published: (2026)
Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows
by: Li, Chenxin, et al.
Published: (2026)
by: Li, Chenxin, et al.
Published: (2026)
PolyReal: A Benchmark for Real-World Polymer Science Workflows
by: Liu, Wanhao, et al.
Published: (2026)
by: Liu, Wanhao, et al.
Published: (2026)
Toward Real-World Table Agents: Capabilities, Workflows, and Design Principles for LLM-based Table Intelligence
by: Tian, Jiaming, et al.
Published: (2025)
by: Tian, Jiaming, et al.
Published: (2025)
FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy Distillation
by: Shum, KaShun, et al.
Published: (2024)
by: Shum, KaShun, et al.
Published: (2024)
PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series
by: Li, Haobo, et al.
Published: (2025)
by: Li, Haobo, et al.
Published: (2025)
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
by: Zhang, Yanjie, et al.
Published: (2026)
by: Zhang, Yanjie, et al.
Published: (2026)
StoryLensEdu: Personalized Learning Report Generation through Narrative-Driven Multi-Agent Systems
by: Shen, Leixian, et al.
Published: (2026)
by: Shen, Leixian, et al.
Published: (2026)
Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
by: Bao, Keqin, et al.
Published: (2025)
by: Bao, Keqin, et al.
Published: (2025)
CellScout: Visual Analytics for Mining Biomarkers in Cell State Discovery
by: Sheng, Rui, et al.
Published: (2025)
by: Sheng, Rui, et al.
Published: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
by: Xiao, Zikai, et al.
Published: (2025)
by: Xiao, Zikai, et al.
Published: (2025)
CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting
by: Li, Haobo, et al.
Published: (2024)
by: Li, Haobo, et al.
Published: (2024)
Plum: Prompt Learning using Metaheuristic
by: Pan, Rui, et al.
Published: (2023)
by: Pan, Rui, et al.
Published: (2023)
Teaching Language Models to Reason with Tools
by: Li, Chengpeng, et al.
Published: (2025)
by: Li, Chengpeng, et al.
Published: (2025)
CaRT: Teaching LLM Agents to Know When They Know Enough
by: Liu, Grace, et al.
Published: (2025)
by: Liu, Grace, et al.
Published: (2025)
WebWorld: A Large-Scale World Model for Web Agent Training
by: Xiao, Zikai, et al.
Published: (2026)
by: Xiao, Zikai, et al.
Published: (2026)
Teaching Writing for the "Real World": Community and Workplace Writing
by: Cox, Michelle, et al.
Published: (2009)
by: Cox, Michelle, et al.
Published: (2009)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
by: Dong, Xuan, et al.
Published: (2026)
by: Dong, Xuan, et al.
Published: (2026)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
by: Xiao, Ruixuan, et al.
Published: (2024)
by: Xiao, Ruixuan, et al.
Published: (2024)
MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
by: Yue, Liang, et al.
Published: (2025)
by: Yue, Liang, et al.
Published: (2025)
TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents
by: Liu, Zhiqiang, et al.
Published: (2026)
by: Liu, Zhiqiang, et al.
Published: (2026)
Multi Layered Autonomy and AI Ecologies in Robotic Art Installations
by: Chen, Baoyang, et al.
Published: (2025)
by: Chen, Baoyang, et al.
Published: (2025)
Benchmarks Underestimate the Readiness of Multi-lingual Dialogue Agents
by: Lee, Andrew H., et al.
Published: (2024)
by: Lee, Andrew H., et al.
Published: (2024)
StuGPTViz: A Visual Analytics Approach to Understand Student-ChatGPT Interactions
by: Chen, Zixin, et al.
Published: (2024)
by: Chen, Zixin, et al.
Published: (2024)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
by: Chu, Zhaoyang, et al.
Published: (2026)
by: Chu, Zhaoyang, et al.
Published: (2026)
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles
by: Wu, Zongru, et al.
Published: (2025)
by: Wu, Zongru, et al.
Published: (2025)
Construction and Experimental Validation of an AI Animation Teaching Platform Driven by Corpus Analysis and Character Animation Generation
by: Xiudong Tu, et al.
Published: (2025)
by: Xiudong Tu, et al.
Published: (2025)
From Data to Story: Towards Automatic Animated Data Video Creation with LLM-based Multi-Agent Systems
by: Shen, Leixian, et al.
Published: (2024)
by: Shen, Leixian, et al.
Published: (2024)
VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference
by: Song, Sicheng, et al.
Published: (2025)
by: Song, Sicheng, et al.
Published: (2025)
Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images
by: Liu, Hongyuan, et al.
Published: (2026)
by: Liu, Hongyuan, et al.
Published: (2026)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
by: Meng, Jinxiang, et al.
Published: (2026)
by: Meng, Jinxiang, et al.
Published: (2026)
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives
by: Meng, Yihao, et al.
Published: (2026)
by: Meng, Yihao, et al.
Published: (2026)
EduAgentQG: A Multi-Agent Workflow Framework for Personalized Question Generation
by: Jia, Rui, et al.
Published: (2025)
by: Jia, Rui, et al.
Published: (2025)
World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems
by: Gupta, Lakshya, et al.
Published: (2026)
by: Gupta, Lakshya, et al.
Published: (2026)
Similar Items
-
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
by: Chen, Zixin, et al.
Published: (2025) -
Predictive Data Selection: The Data That Predicts Is the Data That Teaches
by: Shum, Kashun, et al.
Published: (2025) -
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
by: Hu, Xiaomeng, et al.
Published: (2026) -
DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors
by: Sheng, Rui, et al.
Published: (2026) -
DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows
by: Liu, Zhou, et al.
Published: (2025)