Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Yujia, Wang, Yuanxiang, Guan, Zhenyu, Yang, Tiankun, Bao, Chenxi, Jin, Haopeng, Luo, Jinwen, Zuo, Xinyu, Duan, Lisheng, Liang, Haijin, Ma, Jin, Wang, Xinming, Tao, Ruiwen, Yi, Hongzhu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
von: Jin, Haopeng, et al.
Veröffentlicht: (2026)
von: Jin, Haopeng, et al.
Veröffentlicht: (2026)
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026)
Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
JTCSE: Joint Tensor-Modulus Constraints and Cross-Attention for Unsupervised Contrastive Learning of Sentence Embeddings
von: Zong, Tianyu, et al.
Veröffentlicht: (2025)
von: Zong, Tianyu, et al.
Veröffentlicht: (2025)
MoCha-LD: Temporal-Chunked Latent Diffusion with Motion-Aware Consistency Regularization for Long Video Generation
von: Jin, Haopeng
Veröffentlicht: (2026)
von: Jin, Haopeng
Veröffentlicht: (2026)
CARL-MoE: Communication-Aware Adaptive Routing with Load-Balanced Expert Parallelism for Efficient Mixture-of-Experts Training
von: Jin, Haopeng
Veröffentlicht: (2026)
von: Jin, Haopeng
Veröffentlicht: (2026)
FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers
von: Jin, Haopeng
Veröffentlicht: (2026)
von: Jin, Haopeng
Veröffentlicht: (2026)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
von: Wang, Xingrui, et al.
Veröffentlicht: (2025)
von: Wang, Xingrui, et al.
Veröffentlicht: (2025)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
von: Li, Caorui, et al.
Veröffentlicht: (2025)
von: Li, Caorui, et al.
Veröffentlicht: (2025)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
von: Yang, Liu, et al.
Veröffentlicht: (2025)
von: Yang, Liu, et al.
Veröffentlicht: (2025)
OmniBench: Towards The Future of Universal Omni-Language Models
von: Li, Yizhi, et al.
Veröffentlicht: (2024)
von: Li, Yizhi, et al.
Veröffentlicht: (2024)
MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents
von: Wang, Shouju, et al.
Veröffentlicht: (2026)
von: Wang, Shouju, et al.
Veröffentlicht: (2026)
Excavador (STD-IIE) / Globalización
von: ROBERTO GUERRA MILLIGAN
Veröffentlicht: (2000)
von: ROBERTO GUERRA MILLIGAN
Veröffentlicht: (2000)
Four Eyes Are Better Than Two: Harnessing the Collaborative Potential of Large Models via Differentiated Thinking and Complementary Ensembles
von: Xie, Jun, et al.
Veröffentlicht: (2025)
von: Xie, Jun, et al.
Veröffentlicht: (2025)
Team of One: Cracking Complex Video QA with Model Synergy
von: Xie, Jun, et al.
Veröffentlicht: (2025)
von: Xie, Jun, et al.
Veröffentlicht: (2025)
PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
Image Translation-Based Unsupervised Cross-Modality Domain Adaptation for Medical Image Segmentation
von: Yang, Tao, et al.
Veröffentlicht: (2025)
von: Yang, Tao, et al.
Veröffentlicht: (2025)
OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing
von: Lin, Lixiang, et al.
Veröffentlicht: (2026)
von: Lin, Lixiang, et al.
Veröffentlicht: (2026)
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
von: Han, Feng, et al.
Veröffentlicht: (2025)
von: Han, Feng, et al.
Veröffentlicht: (2025)
IntrinsicWeather: Controllable Weather Editing in Intrinsic Space
von: Zhu, Yixin, et al.
Veröffentlicht: (2025)
von: Zhu, Yixin, et al.
Veröffentlicht: (2025)
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
von: Yu, Tao, et al.
Veröffentlicht: (2026)
von: Yu, Tao, et al.
Veröffentlicht: (2026)
OmniGAIA: Towards Native Omni-Modal AI Agents
von: Li, Xiaoxi, et al.
Veröffentlicht: (2026)
von: Li, Xiaoxi, et al.
Veröffentlicht: (2026)
V2Rho-FNO: Fourier Neural Operator for Electronic Density Prediction
von: Jin, Yingdi, et al.
Veröffentlicht: (2026)
von: Jin, Yingdi, et al.
Veröffentlicht: (2026)
DreamOmni: Unified Image Generation and Editing
von: Xia, Bin, et al.
Veröffentlicht: (2024)
von: Xia, Bin, et al.
Veröffentlicht: (2024)
AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis
von: She, Dong, et al.
Veröffentlicht: (2026)
von: She, Dong, et al.
Veröffentlicht: (2026)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
von: Wang, Xuwu, et al.
Veröffentlicht: (2024)
von: Wang, Xuwu, et al.
Veröffentlicht: (2024)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
von: Wang, Zhepeng, et al.
Veröffentlicht: (2025)
von: Wang, Zhepeng, et al.
Veröffentlicht: (2025)
A Nerf-Based Color Consistency Method for Remote Sensing Images
von: Zuo, Zongcheng, et al.
Veröffentlicht: (2024)
von: Zuo, Zongcheng, et al.
Veröffentlicht: (2024)
Efficient Terrain Stochastic Differential Efficient Terrain Stochastic Differential Equations for Multipurpose Digital Elevation Model Restoration
von: Zhang, Tongtong, et al.
Veröffentlicht: (2024)
von: Zhang, Tongtong, et al.
Veröffentlicht: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
von: Cheng, Xize, et al.
Veröffentlicht: (2024)
von: Cheng, Xize, et al.
Veröffentlicht: (2024)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)
von: Guo, Jiawei, et al.
Veröffentlicht: (2024)
OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation
von: Chang, Jingjing, et al.
Veröffentlicht: (2025)
von: Chang, Jingjing, et al.
Veröffentlicht: (2025)
Image Editing As Programs with Diffusion Models
von: Hu, Yujia, et al.
Veröffentlicht: (2025)
von: Hu, Yujia, et al.
Veröffentlicht: (2025)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
von: Wang, Dianyi, et al.
Veröffentlicht: (2025)
von: Wang, Dianyi, et al.
Veröffentlicht: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
von: Chen, Chen, et al.
Veröffentlicht: (2025)
von: Chen, Chen, et al.
Veröffentlicht: (2025)
Dynamic Deep Graph Learning for Incomplete Multi-View Clustering with Masked Graph Reconstruction Loss
von: Zhang, Zhenghao, et al.
Veröffentlicht: (2025)
von: Zhang, Zhenghao, et al.
Veröffentlicht: (2025)
The exact group-sparse recovery for block diagonal matrices with subexponential entries
von: Dai, Guozheng, et al.
Veröffentlicht: (2025)
von: Dai, Guozheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026) -
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
von: Jin, Haopeng, et al.
Veröffentlicht: (2026) -
RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization
von: Yi, Hongzhu, et al.
Veröffentlicht: (2026) -
Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization
von: Yu, Tao, et al.
Veröffentlicht: (2026) -
FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
von: Cai, Yuxuan, et al.
Veröffentlicht: (2025)