OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yuan, Hou, Saihui, Hou, Saijie, Du, Jiabao, Meng, Shibei, Huang, Yongzhen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
BarbieGait: An Identity-Consistent Synthetic Human Dataset with Versatile Cloth-Changing for Gait Recognition
by: Cai, Qingyuan, et al.
Published: (2026)
by: Cai, Qingyuan, et al.
Published: (2026)
Exploring Deep Models for Practical Gait Recognition
by: Fan, Chao, et al.
Published: (2023)
by: Fan, Chao, et al.
Published: (2023)
OpenGait: A Comprehensive Benchmark Study for Gait Recognition towards Better Practicality
by: Fan, Chao, et al.
Published: (2024)
by: Fan, Chao, et al.
Published: (2024)
FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation
by: Cai, Qingyuan, et al.
Published: (2025)
by: Cai, Qingyuan, et al.
Published: (2025)
GaitSnippet: Gait Recognition Beyond Unordered Sets and Ordered Sequences
by: Hou, Saihui, et al.
Published: (2025)
by: Hou, Saihui, et al.
Published: (2025)
Disentangled Diffusion-Based 3D Human Pose Estimation with Hierarchical Spatial and Temporal Denoiser
by: Cai, Qingyuan, et al.
Published: (2024)
by: Cai, Qingyuan, et al.
Published: (2024)
MMGait: Towards Multi-Modal Gait Recognition
by: Wang, Chenye, et al.
Published: (2026)
by: Wang, Chenye, et al.
Published: (2026)
Progressive Feature Learning for Realistic Cloth-Changing Gait Recognition
by: Ren, Xuqian, et al.
Published: (2022)
by: Ren, Xuqian, et al.
Published: (2022)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
by: Wei, Yuancheng, et al.
Published: (2026)
by: Wei, Yuancheng, et al.
Published: (2026)
OpenAnimals: Revisiting Person Re-Identification for Animals Towards Better Generalization
by: Hou, Saihui, et al.
Published: (2024)
by: Hou, Saihui, et al.
Published: (2024)
Unsupervised Gait Recognition with Selective Fusion
by: Ren, Xuqian, et al.
Published: (2023)
by: Ren, Xuqian, et al.
Published: (2023)
QAGait: Revisit Gait Recognition from a Quality Perspective
by: Wang, Zengbin, et al.
Published: (2024)
by: Wang, Zengbin, et al.
Published: (2024)
OneDiff: A Generalist Model for Image Difference Captioning
by: Hu, Erdong, et al.
Published: (2024)
by: Hu, Erdong, et al.
Published: (2024)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
by: Wu, Peiran, et al.
Published: (2025)
by: Wu, Peiran, et al.
Published: (2025)
Learning Geometric Invariance for Gait Recognition
by: Wang, Zengbin, et al.
Published: (2026)
by: Wang, Zengbin, et al.
Published: (2026)
Fine-grained Image-to-LiDAR Contrastive Distillation with Visual Foundation Models
by: Zhang, Yifan, et al.
Published: (2024)
by: Zhang, Yifan, et al.
Published: (2024)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
by: Zhang, Shi-Xue, et al.
Published: (2025)
by: Zhang, Shi-Xue, et al.
Published: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
by: Tang, Yunlong, et al.
Published: (2025)
by: Tang, Yunlong, et al.
Published: (2025)
Vision Mamba Distillation for Low-resolution Fine-grained Image Classification
by: Chen, Yao, et al.
Published: (2024)
by: Chen, Yao, et al.
Published: (2024)
OmniCaptioner: One Captioner to Rule Them All
by: Lu, Yiting, et al.
Published: (2025)
by: Lu, Yiting, et al.
Published: (2025)
CRS-Diff: Controllable Remote Sensing Image Generation with Diffusion Model
by: Tang, Datao, et al.
Published: (2024)
by: Tang, Datao, et al.
Published: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
by: Ma, Ziyang, et al.
Published: (2025)
by: Ma, Ziyang, et al.
Published: (2025)
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
by: Ren, Yiming, et al.
Published: (2025)
by: Ren, Yiming, et al.
Published: (2025)
Benchmarking and Improving Detail Image Caption
by: Dong, Hongyuan, et al.
Published: (2024)
by: Dong, Hongyuan, et al.
Published: (2024)
FingerCap: Fine-grained Finger-level Hand Motion Captioning
by: Shen, Xin, et al.
Published: (2025)
by: Shen, Xin, et al.
Published: (2025)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
by: Zhao, Ruixiang, et al.
Published: (2026)
by: Zhao, Ruixiang, et al.
Published: (2026)
Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception
by: Peng, Ruotian, et al.
Published: (2025)
by: Peng, Ruotian, et al.
Published: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
Probabilistic Contrastive Learning for Domain Adaptation
by: Li, Junjie, et al.
Published: (2021)
by: Li, Junjie, et al.
Published: (2021)
Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection
by: Liu, Jiaxin, et al.
Published: (2025)
by: Liu, Jiaxin, et al.
Published: (2025)
RSHazeDiff: A Unified Fourier-aware Diffusion Model for Remote Sensing Image Dehazing
by: Xiong, Jiamei, et al.
Published: (2024)
by: Xiong, Jiamei, et al.
Published: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
by: Yao, Linli, et al.
Published: (2023)
by: Yao, Linli, et al.
Published: (2023)
DiffOSeg: Omni Medical Image Segmentation via Multi-Expert Collaboration Diffusion Model
by: Zhang, Han, et al.
Published: (2025)
by: Zhang, Han, et al.
Published: (2025)
DIR: Retrieval-Augmented Image Captioning with Comprehensive Understanding
by: Wu, Hao, et al.
Published: (2024)
by: Wu, Hao, et al.
Published: (2024)
Retrieval-Augmented Egocentric Video Captioning
by: Xu, Jilan, et al.
Published: (2024)
by: Xu, Jilan, et al.
Published: (2024)
ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
by: Peng, Cihang, et al.
Published: (2025)
by: Peng, Cihang, et al.
Published: (2025)
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks
by: Peng, Zhihao, et al.
Published: (2025)
by: Peng, Zhihao, et al.
Published: (2025)
GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification
by: Liu, Xuedeng, et al.
Published: (2025)
by: Liu, Xuedeng, et al.
Published: (2025)
SISP: A Benchmark Dataset for Fine-grained Ship Instance Segmentation in Panchromatic Satellite Images
by: Feng, Pengming, et al.
Published: (2024)
by: Feng, Pengming, et al.
Published: (2024)
Similar Items
-
BarbieGait: An Identity-Consistent Synthetic Human Dataset with Versatile Cloth-Changing for Gait Recognition
by: Cai, Qingyuan, et al.
Published: (2026) -
Exploring Deep Models for Practical Gait Recognition
by: Fan, Chao, et al.
Published: (2023) -
OpenGait: A Comprehensive Benchmark Study for Gait Recognition towards Better Practicality
by: Fan, Chao, et al.
Published: (2024) -
FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation
by: Cai, Qingyuan, et al.
Published: (2025) -
GaitSnippet: Gait Recognition Beyond Unordered Sets and Ordered Sequences
by: Hou, Saihui, et al.
Published: (2025)