Guardado en:
| Autores principales: | Wang, Ziteng, Yang, Siqi, Qiao, Limeng, Ma, Lin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2508.02329 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
por: Ma, Chenrui, et al.
Publicado: (2025)
por: Ma, Chenrui, et al.
Publicado: (2025)
UniViTAR: Unified Vision Transformer with Native Resolution
por: Qiao, Limeng, et al.
Publicado: (2025)
por: Qiao, Limeng, et al.
Publicado: (2025)
FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text
por: Wang, Bingchao, et al.
Publicado: (2025)
por: Wang, Bingchao, et al.
Publicado: (2025)
VeCLIP: Improving CLIP Training via Visual-enriched Captions
por: Lai, Zhengfeng, et al.
Publicado: (2023)
por: Lai, Zhengfeng, et al.
Publicado: (2023)
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
FG-CLIP: Fine-Grained Visual and Textual Alignment
por: Xie, Chunyu, et al.
Publicado: (2025)
por: Xie, Chunyu, et al.
Publicado: (2025)
GazeCLIP: Gaze-Guided CLIP with Adaptive-Enhanced Fine-Grained Language Prompt for Deepfake Attribution and Detection
por: Zhang, Yaning, et al.
Publicado: (2026)
por: Zhang, Yaning, et al.
Publicado: (2026)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
por: Liu, Yanqing, et al.
Publicado: (2024)
por: Liu, Yanqing, et al.
Publicado: (2024)
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
por: Chu, Sanghyeok, et al.
Publicado: (2025)
por: Chu, Sanghyeok, et al.
Publicado: (2025)
GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning
por: Yang, Xiao, et al.
Publicado: (2026)
por: Yang, Xiao, et al.
Publicado: (2026)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
por: Chen, Xiaofu, et al.
Publicado: (2025)
por: Chen, Xiaofu, et al.
Publicado: (2025)
NeuroCLIP: Neuromorphic Data Understanding by CLIP and SNN
por: Guo, Yufei, et al.
Publicado: (2023)
por: Guo, Yufei, et al.
Publicado: (2023)
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
por: Deng, Xueqing, et al.
Publicado: (2025)
por: Deng, Xueqing, et al.
Publicado: (2025)
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
por: Zarei, Arman, et al.
Publicado: (2025)
por: Zarei, Arman, et al.
Publicado: (2025)
Towards Fine-Grained Human Motion Video Captioning
por: Song, Guorui, et al.
Publicado: (2025)
por: Song, Guorui, et al.
Publicado: (2025)
DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks
por: Monsefi, Amin Karimi, et al.
Publicado: (2024)
por: Monsefi, Amin Karimi, et al.
Publicado: (2024)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
por: Qin, Jie, et al.
Publicado: (2025)
por: Qin, Jie, et al.
Publicado: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
por: Kapuriya, Janak, et al.
Publicado: (2025)
por: Kapuriya, Janak, et al.
Publicado: (2025)
CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning
por: Dai, Longchen, et al.
Publicado: (2025)
por: Dai, Longchen, et al.
Publicado: (2025)
FarSLIP: Discovering Effective CLIP Adaptation for Fine-Grained Remote Sensing Understanding
por: Li, Zhenshi, et al.
Publicado: (2025)
por: Li, Zhenshi, et al.
Publicado: (2025)
Parrot Captions Teach CLIP to Spot Text
por: Lin, Yiqi, et al.
Publicado: (2023)
por: Lin, Yiqi, et al.
Publicado: (2023)
MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP
por: Truong, Chau, et al.
Publicado: (2025)
por: Truong, Chau, et al.
Publicado: (2025)
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
por: Yang, Ziteng, et al.
Publicado: (2025)
por: Yang, Ziteng, et al.
Publicado: (2025)
UniComp: Rethinking Video Compression Through Informational Uniqueness
por: Yuan, Chao, et al.
Publicado: (2025)
por: Yuan, Chao, et al.
Publicado: (2025)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
por: Li, YuQian, et al.
Publicado: (2025)
por: Li, YuQian, et al.
Publicado: (2025)
microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification
por: Silva, Sathira, et al.
Publicado: (2025)
por: Silva, Sathira, et al.
Publicado: (2025)
InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
por: Zheng, Haojie, et al.
Publicado: (2026)
por: Zheng, Haojie, et al.
Publicado: (2026)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
Instruct-CLIP: Improving Instruction-Guided Image Editing with Automated Data Refinement Using Contrastive Learning
por: Chen, Sherry X., et al.
Publicado: (2025)
por: Chen, Sherry X., et al.
Publicado: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
por: Lei, Zhenxin, et al.
Publicado: (2025)
por: Lei, Zhenxin, et al.
Publicado: (2025)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
por: Zeng, Zhen, et al.
Publicado: (2024)
por: Zeng, Zhen, et al.
Publicado: (2024)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
por: Guo, Yanan, et al.
Publicado: (2025)
por: Guo, Yanan, et al.
Publicado: (2025)
Sparse Hypergraph-Enhanced Frame-Event Object Detection with Fine-Grained MoE
por: Bao, Wei, et al.
Publicado: (2026)
por: Bao, Wei, et al.
Publicado: (2026)
Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
por: Chang, Yifan, et al.
Publicado: (2025)
por: Chang, Yifan, et al.
Publicado: (2025)
An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing
por: Liang, Zihan, et al.
Publicado: (2025)
por: Liang, Zihan, et al.
Publicado: (2025)
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
por: Zhang, Zhenyu, et al.
Publicado: (2023)
por: Zhang, Zhenyu, et al.
Publicado: (2023)
UltraAD: Fine-Grained Ultrasound Anomaly Classification via Few-Shot CLIP Adaptation
por: Zhou, Yue, et al.
Publicado: (2025)
por: Zhou, Yue, et al.
Publicado: (2025)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
por: Tang, Hao, et al.
Publicado: (2025)
por: Tang, Hao, et al.
Publicado: (2025)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
por: Xu, Jingqi
Publicado: (2026)
por: Xu, Jingqi
Publicado: (2026)
Ejemplares similares
-
Beyond Editing Pairs: Fine-Grained Instructional Image Editing via Multi-Scale Learnable Regions
por: Ma, Chenrui, et al.
Publicado: (2025) -
UniViTAR: Unified Vision Transformer with Native Resolution
por: Qiao, Limeng, et al.
Publicado: (2025) -
FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text
por: Wang, Bingchao, et al.
Publicado: (2025) -
VeCLIP: Improving CLIP Training via Visual-enriched Captions
por: Lai, Zhengfeng, et al.
Publicado: (2023) -
UltraEdit: Instruction-based Fine-Grained Image Editing at Scale
por: Zhao, Haozhe, et al.
Publicado: (2024)