GraphicBench: A Planning Benchmark for Graphic Design with Language Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ki, Dayeon, Zhou, Tianyi, Carpuat, Marine, Wu, Gang, Mathur, Puneet, Swaminathan, Viswanathan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Input Rewriting Improves Translation with Large Language Models
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
Guiding Large Language Models to Post-Edit Machine Translation with Error Annotations
par: Ki, Dayeon, et autres
Publié: (2024)
par: Ki, Dayeon, et autres
Publié: (2024)
Multiple LLM Agents Debate for Equitable Cultural Alignment
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translation
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
par: Ki, Dayeon, et autres
Publié: (2026)
par: Ki, Dayeon, et autres
Publié: (2026)
Pragmatics Meets Culture: Culturally-adapted Artwork Description Generation and Evaluation
par: Zhao, Lingjun, et autres
Publié: (2026)
par: Zhao, Lingjun, et autres
Publié: (2026)
Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms
par: Ki, Dayeon, et autres
Publié: (2026)
par: Ki, Dayeon, et autres
Publié: (2026)
AskQE: Question Answering as Automatic Evaluation for Machine Translation
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
Should We be Pedantic About Reasoning Errors in Machine Translation?
par: Bao, Calvin, et autres
Publié: (2026)
par: Bao, Calvin, et autres
Publié: (2026)
Keep It Private: Unsupervised Privatization of Online Text
par: Bao, Calvin, et autres
Publié: (2024)
par: Bao, Calvin, et autres
Publié: (2024)
Training Computer Use Agents to Assess the Usability of Graphical User Interfaces
par: Gao, Alice, et autres
Publié: (2026)
par: Gao, Alice, et autres
Publié: (2026)
Can They Dixit? Yes they Can! Dixit as a Playground for Multimodal Language Model Capabilities
par: Balepur, Nishant, et autres
Publié: (2025)
par: Balepur, Nishant, et autres
Publié: (2025)
Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks
par: Deganutti, Adrienne, et autres
Publié: (2026)
par: Deganutti, Adrienne, et autres
Publié: (2026)
Graphic Design with Large Multimodal Model
par: Cheng, Yutao, et autres
Publié: (2024)
par: Cheng, Yutao, et autres
Publié: (2024)
AutoGRAMS: Autonomous Graphical Agent Modeling Software
par: Krause, Ben, et autres
Publié: (2024)
par: Krause, Ben, et autres
Publié: (2024)
Mitigating Semantic Leakage in Cross-lingual Embeddings via Orthogonality Constraint
par: Ki, Dayeon, et autres
Publié: (2024)
par: Ki, Dayeon, et autres
Publié: (2024)
Plausibly Problematic Questions in Multiple-Choice Benchmarks for Commonsense Reasoning
par: Palta, Shramay, et autres
Publié: (2024)
par: Palta, Shramay, et autres
Publié: (2024)
Text Style Transfer with Machine Translation for Graphic Designs
par: Budhauria, Deergh Singh, et autres
Publié: (2026)
par: Budhauria, Deergh Singh, et autres
Publié: (2026)
ChartCitor: Multi-Agent Framework for Fine-Grained Chart Visual Attribution
par: Goswami, Kanika, et autres
Publié: (2025)
par: Goswami, Kanika, et autres
Publié: (2025)
PlotGen: Multi-Agent LLM-based Scientific Data Visualization via Multimodal Feedback
par: Goswami, Kanika, et autres
Publié: (2025)
par: Goswami, Kanika, et autres
Publié: (2025)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
Cross-lingual QA: A Key to Unlocking In-context Cross-lingual Performance
par: Kim, Sunkyoung, et autres
Publié: (2023)
par: Kim, Sunkyoung, et autres
Publié: (2023)
Visually Descriptive Language Model for Vector Graphics Reasoning
par: Wang, Zhenhailong, et autres
Publié: (2024)
par: Wang, Zhenhailong, et autres
Publié: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
Words as Bridges: Exploring Computational Support for Cross-Disciplinary Translation Work
par: Bao, Calvin, et autres
Publié: (2025)
par: Bao, Calvin, et autres
Publié: (2025)
Structured Uncertainty guided Clarification for LLM Agents
par: Suri, Manan, et autres
Publié: (2025)
par: Suri, Manan, et autres
Publié: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
par: He, Muyu, et autres
Publié: (2026)
par: He, Muyu, et autres
Publié: (2026)
GEM-RAG: Graphical Eigen Memories For Retrieval Augmented Generation
par: Rappazzo, Brendan Hogan, et autres
Publié: (2024)
par: Rappazzo, Brendan Hogan, et autres
Publié: (2024)
Causal Graphical Models for Vision-Language Compositional Understanding
par: Parascandolo, Fiorenzo, et autres
Publié: (2024)
par: Parascandolo, Fiorenzo, et autres
Publié: (2024)
Shadow-Loom: Causal Reasoning over Graphical World Models of Narratives
par: Wilmot, David
Publié: (2026)
par: Wilmot, David
Publié: (2026)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
par: Sun, Weiwei, et autres
Publié: (2025)
par: Sun, Weiwei, et autres
Publié: (2025)
Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG
par: Ki, Dayeon, et autres
Publié: (2025)
par: Ki, Dayeon, et autres
Publié: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
par: Tang, Xiangru, et autres
Publié: (2025)
par: Tang, Xiangru, et autres
Publié: (2025)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
par: Wang, Shouju, et autres
Publié: (2026)
par: Wang, Shouju, et autres
Publié: (2026)
BayesAgent: Bayesian Agentic Reasoning Under Uncertainty via Verbalized Probabilistic Graphical Modeling
par: Huang, Hengguan, et autres
Publié: (2024)
par: Huang, Hengguan, et autres
Publié: (2024)
Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents
par: Qing, Peijun, et autres
Publié: (2026)
par: Qing, Peijun, et autres
Publié: (2026)
Leveraging Large Language Models for Active Merchant Non-player Characters
par: Kim, Byungjun, et autres
Publié: (2024)
par: Kim, Byungjun, et autres
Publié: (2024)
Can Large Language Models Understand Symbolic Graphics Programs?
par: Qiu, Zeju, et autres
Publié: (2024)
par: Qiu, Zeju, et autres
Publié: (2024)
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
par: Nguyen, Bang, et autres
Publié: (2026)
par: Nguyen, Bang, et autres
Publié: (2026)
Documents similaires
-
Automatic Input Rewriting Improves Translation with Large Language Models
par: Ki, Dayeon, et autres
Publié: (2025) -
Guiding Large Language Models to Post-Edit Machine Translation with Error Annotations
par: Ki, Dayeon, et autres
Publié: (2024) -
Multiple LLM Agents Debate for Equitable Cultural Alignment
par: Ki, Dayeon, et autres
Publié: (2025) -
Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translation
par: Ki, Dayeon, et autres
Publié: (2025) -
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
par: Ki, Dayeon, et autres
Publié: (2026)