OneDiff: A Generalist Model for Image Difference Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Erdong, Guo, Longteng, Yue, Tongtian, Zhao, Zijia, Xue, Shuning, Liu, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval
di: Zhao, Zijia, et al.
Pubblicazione: (2024)
di: Zhao, Zijia, et al.
Pubblicazione: (2024)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
di: Song, Zijie, et al.
Pubblicazione: (2023)
di: Song, Zijie, et al.
Pubblicazione: (2023)
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
di: Yue, Tongtian, et al.
Pubblicazione: (2025)
di: Yue, Tongtian, et al.
Pubblicazione: (2025)
Cross Modification Attention Based Deliberation Model for Image Captioning
di: Lian, Zheng, et al.
Pubblicazione: (2021)
di: Lian, Zheng, et al.
Pubblicazione: (2021)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
di: Zi, Xing, et al.
Pubblicazione: (2025)
di: Zi, Xing, et al.
Pubblicazione: (2025)
DiffBrush:Just Painting the Art by Your Hands
di: Chu, Jiaming, et al.
Pubblicazione: (2025)
di: Chu, Jiaming, et al.
Pubblicazione: (2025)
M2ORT: Many-To-One Regression Transformer for Spatial Transcriptomics Prediction from Histopathology Images
di: Wang, Hongyi, et al.
Pubblicazione: (2024)
di: Wang, Hongyi, et al.
Pubblicazione: (2024)
See or Guess: Counterfactually Regularized Image Captioning
di: Cao, Qian, et al.
Pubblicazione: (2024)
di: Cao, Qian, et al.
Pubblicazione: (2024)
Referring Flexible Image Restoration
di: Guan, Runwei, et al.
Pubblicazione: (2024)
di: Guan, Runwei, et al.
Pubblicazione: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
ReactDiff: Latent Diffusion for Facial Reaction Generation
di: Li, Jiaming, et al.
Pubblicazione: (2025)
di: Li, Jiaming, et al.
Pubblicazione: (2025)
Image Difference Grounding with Natural Language
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
ProCap: Projection-Aware Captioning for Spatial Augmented Reality
di: Cao, Zimo, et al.
Pubblicazione: (2026)
di: Cao, Zimo, et al.
Pubblicazione: (2026)
Efficient Motion-Aware Video MLLM
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
di: Zhao, Zijia, et al.
Pubblicazione: (2025)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
di: Yao, Linli, et al.
Pubblicazione: (2023)
di: Yao, Linli, et al.
Pubblicazione: (2023)
Self-supervised Photographic Image Layout Representation Learning
di: Zhao, Zhaoran, et al.
Pubblicazione: (2024)
di: Zhao, Zhaoran, et al.
Pubblicazione: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness
di: Cha, SeungJu, et al.
Pubblicazione: (2025)
di: Cha, SeungJu, et al.
Pubblicazione: (2025)
Calibration & Reconstruction: Deep Integrated Language for Referring Image Segmentation
di: Yan, Yichen, et al.
Pubblicazione: (2024)
di: Yan, Yichen, et al.
Pubblicazione: (2024)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
MU-MAE: Multimodal Masked Autoencoders-Based One-Shot Learning
di: Liu, Rex, et al.
Pubblicazione: (2024)
di: Liu, Rex, et al.
Pubblicazione: (2024)
SFFNet: Synergistic Feature Fusion Network With Dual-Domain Edge Enhancement for UAV Image Object Detection
di: Zhang, Wenfeng, et al.
Pubblicazione: (2026)
di: Zhang, Wenfeng, et al.
Pubblicazione: (2026)
OneHOI: Unifying Human-Object Interaction Generation and Editing
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2026)
di: Hoe, Jiun Tian, et al.
Pubblicazione: (2026)
Towards Retrieval-Augmented Architectures for Image Captioning
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
JIGMARK: A Black-Box Approach for Enhancing Image Watermarks against Diffusion Model Edits
di: Pan, Minzhou, et al.
Pubblicazione: (2024)
di: Pan, Minzhou, et al.
Pubblicazione: (2024)
PFB-Diff: Progressive Feature Blending Diffusion for Text-driven Image Editing
di: Huang, Wenjing, et al.
Pubblicazione: (2023)
di: Huang, Wenjing, et al.
Pubblicazione: (2023)
CPSL: Representing Volumetric Video via Content-Promoted Scene Layers
di: Hu, Kaiyuan, et al.
Pubblicazione: (2025)
di: Hu, Kaiyuan, et al.
Pubblicazione: (2025)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
di: Cai, Qi, et al.
Pubblicazione: (2026)
di: Cai, Qi, et al.
Pubblicazione: (2026)
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
di: Song, Jiale, et al.
Pubblicazione: (2026)
di: Song, Jiale, et al.
Pubblicazione: (2026)
Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
di: Luo, Jianjie, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
di: Wang, Xue, et al.
Pubblicazione: (2026)
di: Wang, Xue, et al.
Pubblicazione: (2026)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
di: Lin, Haoqiang, et al.
Pubblicazione: (2025)
di: Lin, Haoqiang, et al.
Pubblicazione: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ChatSearch: a Dataset and a Generative Retrieval Model for General Conversational Image Retrieval
di: Zhao, Zijia, et al.
Pubblicazione: (2024) -
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025) -
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
di: Wang, Jiuniu, et al.
Pubblicazione: (2025) -
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
di: Song, Zijie, et al.
Pubblicazione: (2023) -
LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation
di: Yue, Tongtian, et al.
Pubblicazione: (2025)