IDEA-Bench: How Far are Generative Models from Professional Designing?
Fuente:
arXiv
Saved in:
| Main Authors: | Liang, Chen, Huang, Lianghua, Fang, Jingwu, Dou, Huanzhang, Wang, Wei, Wu, Zhi-Fan, Shi, Yupeng, Zhang, Junge, Zhao, Xin, Liu, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Group Diffusion Transformers are Unsupervised Multitask Learners
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models
by: Dou, Huanzhang, et al.
Published: (2024)
by: Dou, Huanzhang, et al.
Published: (2024)
DynamicEarth: How Far are We from Open-Vocabulary Change Detection?
by: Li, Kaiyu, et al.
Published: (2025)
by: Li, Kaiyu, et al.
Published: (2025)
SemanticMIM: Marring Masked Image Modeling with Semantics Compression for General Visual Representation
by: Yuan, Yike, et al.
Published: (2024)
by: Yuan, Yike, et al.
Published: (2024)
ScanFormer: Referring Expression Comprehension by Iteratively Scanning
by: Su, Wei, et al.
Published: (2024)
by: Su, Wei, et al.
Published: (2024)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
by: Zhou, Yupeng, et al.
Published: (2026)
by: Zhou, Yupeng, et al.
Published: (2026)
ImageAttributionBench: How Far Are We from Generalizable Attribution?
by: Mou, Tingshu, et al.
Published: (2026)
by: Mou, Tingshu, et al.
Published: (2026)
CLASH: Complementary Learning with Neural Architecture Search for Gait Recognition
by: Dou, Huanzhang, et al.
Published: (2024)
by: Dou, Huanzhang, et al.
Published: (2024)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
by: Han, Haonan, et al.
Published: (2026)
by: Han, Haonan, et al.
Published: (2026)
Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
by: Yan, Xinchen, et al.
Published: (2025)
by: Yan, Xinchen, et al.
Published: (2025)
How Far do Lindbladians Go?
by: Cai, Jihong, et al.
Published: (2025)
by: Cai, Jihong, et al.
Published: (2025)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
by: Wu, Tao, et al.
Published: (2024)
by: Wu, Tao, et al.
Published: (2024)
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention
by: Zhang, Wenhu, et al.
Published: (2026)
by: Zhang, Wenhu, et al.
Published: (2026)
FlashFace: Human Image Personalization with High-fidelity Identity Preservation
by: Zhang, Shilong, et al.
Published: (2024)
by: Zhang, Shilong, et al.
Published: (2024)
AnyDoor: Zero-shot Object-level Image Customization
by: Chen, Xi, et al.
Published: (2023)
by: Chen, Xi, et al.
Published: (2023)
Enhancing Generalized Few-Shot Semantic Segmentation via Effective Knowledge Transfer
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
How Far is Video Generation from World Model: A Physical Law Perspective
by: Kang, Bingyi, et al.
Published: (2024)
by: Kang, Bingyi, et al.
Published: (2024)
VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?
by: Kim, Minkyu, et al.
Published: (2026)
by: Kim, Minkyu, et al.
Published: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
by: Li, Yifei, et al.
Published: (2025)
by: Li, Yifei, et al.
Published: (2025)
How Far Are Video Models from True Multimodal Reasoning?
by: Zhang, Xiaotian, et al.
Published: (2026)
by: Zhang, Xiaotian, et al.
Published: (2026)
OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation
by: Chang, Jingjing, et al.
Published: (2025)
by: Chang, Jingjing, et al.
Published: (2025)
How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
by: Li, Zhiheng, et al.
Published: (2026)
by: Li, Zhiheng, et al.
Published: (2026)
Reasoning to Attend: Try to Understand How <SEG> Token Works
by: Qian, Rui, et al.
Published: (2024)
by: Qian, Rui, et al.
Published: (2024)
IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation
by: Tang, Yinghao, et al.
Published: (2026)
by: Tang, Yinghao, et al.
Published: (2026)
Hierarchical Salient Patch Identification for Interpretable Fundus Disease Localization
by: Peng, Yitao, et al.
Published: (2024)
by: Peng, Yitao, et al.
Published: (2024)
ProtoSolo: Interpretable Image Classification via Single-Prototype Activation
by: Peng, Yitao, et al.
Published: (2025)
by: Peng, Yitao, et al.
Published: (2025)
How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark
by: Liu, Yuanye, et al.
Published: (2026)
by: Liu, Yuanye, et al.
Published: (2026)
How Far Can We Compress Instant-NGP-Based NeRF?
by: Chen, Yihang, et al.
Published: (2024)
by: Chen, Yihang, et al.
Published: (2024)
How Far Are We from Generating Missing Modalities with Foundation Models?
by: Ke, Guanzhou, et al.
Published: (2025)
by: Ke, Guanzhou, et al.
Published: (2025)
AdaTreeFormer: Few Shot Domain Adaptation for Tree Counting from a Single High-Resolution Image
by: Amirkolaee, Hamed Amini, et al.
Published: (2024)
by: Amirkolaee, Hamed Amini, et al.
Published: (2024)
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
by: Chen, Zhe, et al.
Published: (2024)
by: Chen, Zhe, et al.
Published: (2024)
P-MapNet: Far-seeing Map Generator Enhanced by both SDMap and HDMap Priors
by: Jiang, Zhou, et al.
Published: (2024)
by: Jiang, Zhou, et al.
Published: (2024)
Autoregressive Pre-Training on Pixels and Texts
by: Chai, Yekun, et al.
Published: (2024)
by: Chai, Yekun, et al.
Published: (2024)
IDEA: Image Description Enhanced CLIP-Adapter
by: Ye, Zhipeng, et al.
Published: (2025)
by: Ye, Zhipeng, et al.
Published: (2025)
OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?
by: Chen, Xuetian, et al.
Published: (2025)
by: Chen, Xuetian, et al.
Published: (2025)
IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?
by: Chen, Yang, et al.
Published: (2025)
by: Chen, Yang, et al.
Published: (2025)
Benchmarking In-the-wild Multimodal Disease Recognition and A Versatile Baseline
by: Wei, Tianqi, et al.
Published: (2024)
by: Wei, Tianqi, et al.
Published: (2024)
VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations
by: Xie, Yupeng, et al.
Published: (2025)
by: Xie, Yupeng, et al.
Published: (2025)
Similar Items
-
Group Diffusion Transformers are Unsupervised Multitask Learners
by: Huang, Lianghua, et al.
Published: (2024) -
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024) -
ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024) -
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models
by: Dou, Huanzhang, et al.
Published: (2024) -
DynamicEarth: How Far are We from Open-Vocabulary Change Detection?
by: Li, Kaiyu, et al.
Published: (2025)