AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
Fuente:
arXiv
Saved in:
| Main Authors: | Mankodiya, Harsh, Gallik, Chase, Galanos, Theodoros, Mulyar, Andriy |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Nomic Embed Vision: Expanding the Latent Space
by: Nussbaum, Zach, et al.
Published: (2024)
by: Nussbaum, Zach, et al.
Published: (2024)
Nomic Embed: Training a Reproducible Long Context Text Embedder
by: Nussbaum, Zach, et al.
Published: (2024)
by: Nussbaum, Zach, et al.
Published: (2024)
AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding
by: Kondratenko, Aleksei, et al.
Published: (2026)
by: Kondratenko, Aleksei, et al.
Published: (2026)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
by: Zhang, Haoran, et al.
Published: (2025)
by: Zhang, Haoran, et al.
Published: (2025)
AEC — Axiomatic Engine Cycle v0.1 — Initial Specification Draft
by: Brown, Cameron
Published: (2026)
by: Brown, Cameron
Published: (2026)
LiveAgentBench: Comprehensive Benchmarking of Agentic Systems Across 104 Real-World Challenges
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems
by: Tallam, Krti
Published: (2026)
by: Tallam, Krti
Published: (2026)
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
by: Liang, Chen, et al.
Published: (2025)
by: Liang, Chen, et al.
Published: (2025)
ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems
by: Sigdel, Akshey, et al.
Published: (2026)
by: Sigdel, Akshey, et al.
Published: (2026)
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing
by: Ma, Haoxuan, et al.
Published: (2026)
by: Ma, Haoxuan, et al.
Published: (2026)
FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
by: Zhou, Qixing, et al.
Published: (2026)
by: Zhou, Qixing, et al.
Published: (2026)
AutoMedBench: Towards Medical AutoResearch with Agentic AI Models
by: Liu, Junqi, et al.
Published: (2026)
by: Liu, Junqi, et al.
Published: (2026)
SastBench: A Benchmark for Testing Agentic SAST Triage
by: Feiglin, Jake, et al.
Published: (2026)
by: Feiglin, Jake, et al.
Published: (2026)
PetroBench: A Benchmark for Large Language Models in Petroleum Engineering
by: Wang, Xiang, et al.
Published: (2026)
by: Wang, Xiang, et al.
Published: (2026)
GitGoodBench: A Novel Benchmark For Evaluating Agentic Performance On Git
by: Lindenbauer, Tobias, et al.
Published: (2025)
by: Lindenbauer, Tobias, et al.
Published: (2025)
VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
by: Zhu, Xuanyu, et al.
Published: (2026)
by: Zhu, Xuanyu, et al.
Published: (2026)
LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
by: He, Hang, et al.
Published: (2025)
by: He, Hang, et al.
Published: (2025)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
by: Wang, Zeyu, et al.
Published: (2026)
by: Wang, Zeyu, et al.
Published: (2026)
ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering
by: Imajuku, Yuki, et al.
Published: (2025)
by: Imajuku, Yuki, et al.
Published: (2025)
MM-OptBench: A Solver-Grounded Benchmark for Multimodal Optimization Modeling
by: Li, Zhong, et al.
Published: (2026)
by: Li, Zhong, et al.
Published: (2026)
FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning
by: Mao, Mingyang, et al.
Published: (2026)
by: Mao, Mingyang, et al.
Published: (2026)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
by: Chen, Wanyi, et al.
Published: (2026)
by: Chen, Wanyi, et al.
Published: (2026)
MU-Bench: A Multitask Multimodal Benchmark for Machine Unlearning
by: Cheng, Jiali, et al.
Published: (2024)
by: Cheng, Jiali, et al.
Published: (2024)
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
by: Wang, Yuhang, et al.
Published: (2026)
by: Wang, Yuhang, et al.
Published: (2026)
EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents
by: Liu, Yunqi, et al.
Published: (2026)
by: Liu, Yunqi, et al.
Published: (2026)
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
by: Xu, Peiran, et al.
Published: (2025)
by: Xu, Peiran, et al.
Published: (2025)
Learning to Construct Practical Agentic Systems
by: Kumar, Aditya, et al.
Published: (2026)
by: Kumar, Aditya, et al.
Published: (2026)
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
by: Desikan, Prasanna, et al.
Published: (2026)
by: Desikan, Prasanna, et al.
Published: (2026)
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
by: Zhou, Xiyuan, et al.
Published: (2025)
by: Zhou, Xiyuan, et al.
Published: (2025)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
by: Yang, Jie, et al.
Published: (2026)
by: Yang, Jie, et al.
Published: (2026)
OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding
by: Ding, Deming, et al.
Published: (2026)
by: Ding, Deming, et al.
Published: (2026)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
by: Fu, Deqing, et al.
Published: (2024)
by: Fu, Deqing, et al.
Published: (2024)
HW-GPT-Bench: Hardware-Aware Architecture Benchmark for Language Models
by: Sukthanker, Rhea Sanjay, et al.
Published: (2024)
by: Sukthanker, Rhea Sanjay, et al.
Published: (2024)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
by: Zhang, Zhe, et al.
Published: (2025)
by: Zhang, Zhe, et al.
Published: (2025)
NeuroBench: A Framework for Benchmarking Neuromorphic Computing Algorithms and Systems
by: Yik, Jason, et al.
Published: (2023)
by: Yik, Jason, et al.
Published: (2023)
TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering
by: Zheng, Jinglai, et al.
Published: (2026)
by: Zheng, Jinglai, et al.
Published: (2026)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
by: Choi, Chanyeol, et al.
Published: (2025)
by: Choi, Chanyeol, et al.
Published: (2025)
Ethics of Artificial Intelligence and Robotics in the Architecture, Engineering, and Construction Industry
by: Liang, Ci-Jyun, et al.
Published: (2023)
by: Liang, Ci-Jyun, et al.
Published: (2023)
SafeAgent: A Runtime Protection Architecture for Agentic Systems
by: Liu, Hailin, et al.
Published: (2026)
by: Liu, Hailin, et al.
Published: (2026)
Similar Items
-
Nomic Embed Vision: Expanding the Latent Space
by: Nussbaum, Zach, et al.
Published: (2024) -
Nomic Embed: Training a Reproducible Long Context Text Embedder
by: Nussbaum, Zach, et al.
Published: (2024) -
AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding
by: Kondratenko, Aleksei, et al.
Published: (2026) -
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
by: Zhang, Haoran, et al.
Published: (2025) -
AEC — Axiomatic Engine Cycle v0.1 — Initial Specification Draft
by: Brown, Cameron
Published: (2026)