NEWSAGENT: Benchmarking Multimodal Agents as Journalists with Real-World Newswriting Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chien, Yen-Che, Wang, Kuang-Da, Wang, Wei-Yao, Peng, Wen-Chih |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
APAR: Modeling Irregular Target Functions in Tabular Regression via Arithmetic-Aware Pre-Training and Adaptive-Regularized Fine-Tuning
par: Wu, Hong-Wei, et autres
Publié: (2024)
par: Wu, Hong-Wei, et autres
Publié: (2024)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
par: Chu, Zhaoyang, et autres
Publié: (2026)
par: Chu, Zhaoyang, et autres
Publié: (2026)
Offline Imitation of Badminton Player Behavior via Experiential Contexts and Brownian Motion
par: Wang, Kuang-Da, et autres
Publié: (2024)
par: Wang, Kuang-Da, et autres
Publié: (2024)
Imitation Learning of Correlated Policies in Stackelberg Games
par: Wang, Kuang-Da, et autres
Publié: (2025)
par: Wang, Kuang-Da, et autres
Publié: (2025)
Benchmarking Stroke Forecasting with Stroke-Level Badminton Dataset
par: Wang, Wei-Yao, et autres
Publié: (2023)
par: Wang, Wei-Yao, et autres
Publié: (2023)
Root Cause Analysis In Microservice Using Neural Granger Causal Discovery
par: Lin, Cheng-Ming, et autres
Publié: (2024)
par: Lin, Cheng-Ming, et autres
Publié: (2024)
BADGE: BADminton report Generation and Evaluation with LLM
par: Chiang, Shang-Hsuan, et autres
Publié: (2024)
par: Chiang, Shang-Hsuan, et autres
Publié: (2024)
HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
par: Cui, Fan, et autres
Publié: (2026)
par: Cui, Fan, et autres
Publié: (2026)
Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization
par: Chi, Yizhe, et autres
Publié: (2026)
par: Chi, Yizhe, et autres
Publié: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
par: Ni, Ziyi, et autres
Publié: (2025)
par: Ni, Ziyi, et autres
Publié: (2025)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
par: Xie, Tianbao, et autres
Publié: (2024)
par: Xie, Tianbao, et autres
Publié: (2024)
TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents
par: Liu, Zhiqiang, et autres
Publié: (2026)
par: Liu, Zhiqiang, et autres
Publié: (2026)
DataTales: A Benchmark for Real-World Intelligent Data Narration
par: Yang, Yajing, et autres
Publié: (2024)
par: Yang, Yajing, et autres
Publié: (2024)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
par: Long, Xiang, et autres
Publié: (2026)
par: Long, Xiang, et autres
Publié: (2026)
Time-IMM: A Dataset and Benchmark for Irregular Multimodal Multivariate Time Series
par: Chang, Ching, et autres
Publié: (2025)
par: Chang, Ching, et autres
Publié: (2025)
Adaptive Reasoning and Acting in Medical Language Agents
par: Dutta, Abhishek, et autres
Publié: (2024)
par: Dutta, Abhishek, et autres
Publié: (2024)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation
par: Wang, Wenhao, et autres
Publié: (2026)
par: Wang, Wenhao, et autres
Publié: (2026)
Are Agents Ready to Teach? A Multi-Stage Benchmark for Real-World Teaching Workflows
par: Chen, Zixin, et autres
Publié: (2026)
par: Chen, Zixin, et autres
Publié: (2026)
$τ$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
par: Yao, Shunyu, et autres
Publié: (2024)
par: Yao, Shunyu, et autres
Publié: (2024)
AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks
par: Jorf, Baraa Al, et autres
Publié: (2026)
par: Jorf, Baraa Al, et autres
Publié: (2026)
WebGen-V Bench: Structured Representation for Enhancing Visual Design in LLM-based Web Generation and Evaluation
par: Wang, Kuang-Da, et autres
Publié: (2025)
par: Wang, Kuang-Da, et autres
Publié: (2025)
TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
par: Wei, Shaohang, et autres
Publié: (2025)
par: Wei, Shaohang, et autres
Publié: (2025)
A Survey on Self-Supervised Learning for Non-Sequential Tabular Data
par: Wang, Wei-Yao, et autres
Publié: (2024)
par: Wang, Wei-Yao, et autres
Publié: (2024)
Smart Language Agents in Real-World Planning
par: Miin, Annabelle, et autres
Publié: (2024)
par: Miin, Annabelle, et autres
Publié: (2024)
DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis
par: Zhang, Qiaohong, et autres
Publié: (2026)
par: Zhang, Qiaohong, et autres
Publié: (2026)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
par: Song, Zhiheng, et autres
Publié: (2026)
par: Song, Zhiheng, et autres
Publié: (2026)
RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction
par: Bian, Haonan, et autres
Publié: (2026)
par: Bian, Haonan, et autres
Publié: (2026)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
par: Fu, Yuchuan, et autres
Publié: (2025)
par: Fu, Yuchuan, et autres
Publié: (2025)
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
par: Liu, Weichen, et autres
Publié: (2025)
par: Liu, Weichen, et autres
Publié: (2025)
MMTABREAL: Real-World Benchmark for Multimodal Table Understanding
par: Titiya, Prasham, et autres
Publié: (2025)
par: Titiya, Prasham, et autres
Publié: (2025)
Towards Autonomous Agents: Adaptive-planning, Reasoning, and Acting in Language Models
par: Dutta, Abhishek, et autres
Publié: (2024)
par: Dutta, Abhishek, et autres
Publié: (2024)
AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
par: Li, Keyu, et autres
Publié: (2026)
par: Li, Keyu, et autres
Publié: (2026)
Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue
par: Gao, Ning, et autres
Publié: (2026)
par: Gao, Ning, et autres
Publié: (2026)
SimuWoB: Simulating Real-World Mobile Apps for Fast and Faithful GUI Agent Benchmarking
par: Liu, Guohong, et autres
Publié: (2026)
par: Liu, Guohong, et autres
Publié: (2026)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks
par: Gao, Hengjian, et autres
Publié: (2026)
par: Gao, Hengjian, et autres
Publié: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
par: Shen, Yuanzhe, et autres
Publié: (2026)
par: Shen, Yuanzhe, et autres
Publié: (2026)
An Intelligent AI glasses System with Multi-Agent Architecture for Real-Time Voice Processing and Task Execution
par: Chen, Sheng-Kai, et autres
Publié: (2026)
par: Chen, Sheng-Kai, et autres
Publié: (2026)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
par: Ye, Fangda, et autres
Publié: (2026)
par: Ye, Fangda, et autres
Publié: (2026)
Documents similaires
-
APAR: Modeling Irregular Target Functions in Tabular Regression via Arithmetic-Aware Pre-Training and Adaptive-Regularized Fine-Tuning
par: Wu, Hong-Wei, et autres
Publié: (2024) -
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
par: Chu, Zhaoyang, et autres
Publié: (2026) -
Offline Imitation of Badminton Player Behavior via Experiential Contexts and Brownian Motion
par: Wang, Kuang-Da, et autres
Publié: (2024) -
Imitation Learning of Correlated Policies in Stackelberg Games
par: Wang, Kuang-Da, et autres
Publié: (2025) -
Benchmarking Stroke Forecasting with Stroke-Level Badminton Dataset
par: Wang, Wei-Yao, et autres
Publié: (2023)