Guardado en:
| Autores principales: | Tan, Zhiya, Zhang, Xin, Zhou, Joey Tianyi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2506.02405 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
por: Huang, Jing, et al.
Publicado: (2025)
por: Huang, Jing, et al.
Publicado: (2025)
AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences
por: Li, Jieyu, et al.
Publicado: (2025)
por: Li, Jieyu, et al.
Publicado: (2025)
Evolution-aware VAriance (EVA) Coreset Selection for Medical Image Classification
por: Hong, Yuxin, et al.
Publicado: (2024)
por: Hong, Yuxin, et al.
Publicado: (2024)
Evolving from Single-modal to Multi-modal Facial Deepfake Detection: Progress and Challenges
por: Liu, Ping, et al.
Publicado: (2024)
por: Liu, Ping, et al.
Publicado: (2024)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
por: Hu, Juncheng, et al.
Publicado: (2026)
por: Hu, Juncheng, et al.
Publicado: (2026)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
por: Zhang, Yuanhong, et al.
Publicado: (2026)
por: Zhang, Yuanhong, et al.
Publicado: (2026)
Breaking Class Barriers: Efficient Dataset Distillation via Inter-Class Feature Compensator
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
Data-independent Module-aware Pruning for Hierarchical Vision Transformers
por: He, Yang, et al.
Publicado: (2024)
por: He, Yang, et al.
Publicado: (2024)
DDL: A Large-Scale Datasets for Deepfake Detection and Localization in Diversified Real-World Scenarios
por: Miao, Changtao, et al.
Publicado: (2025)
por: Miao, Changtao, et al.
Publicado: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
por: Liu, Xin, et al.
Publicado: (2024)
por: Liu, Xin, et al.
Publicado: (2024)
Beyond Modality Collapse: Representations Blending for Multimodal Dataset Distillation
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
Diversity-Driven Synthesis: Enhancing Dataset Distillation through Directed Weight Adjustment
por: Du, Jiawei, et al.
Publicado: (2024)
por: Du, Jiawei, et al.
Publicado: (2024)
Spanning Training Progress: Temporal Dual-Depth Scoring (TDDS) for Enhanced Dataset Pruning
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Garment Attribute Manipulation with Multi-level Attention
por: Casula, Vittorio, et al.
Publicado: (2024)
por: Casula, Vittorio, et al.
Publicado: (2024)
KPL: Training-Free Medical Knowledge Mining of Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models
por: Zhang, Zhifang, et al.
Publicado: (2025)
por: Zhang, Zhifang, et al.
Publicado: (2025)
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
por: Deng, Jinhong, et al.
Publicado: (2025)
por: Deng, Jinhong, et al.
Publicado: (2025)
Multisize Dataset Condensation
por: He, Yang, et al.
Publicado: (2024)
por: He, Yang, et al.
Publicado: (2024)
PVP: Polar Representation Boost for 3D Semantic Occupancy Prediction
por: Xue, Yujing, et al.
Publicado: (2024)
por: Xue, Yujing, et al.
Publicado: (2024)
Low-Level Dataset Distillation for Medical Image Enhancement
por: Xu, Fengzhi, et al.
Publicado: (2025)
por: Xu, Fengzhi, et al.
Publicado: (2025)
IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation
por: Wang, Chenru, et al.
Publicado: (2026)
por: Wang, Chenru, et al.
Publicado: (2026)
TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery
por: Zhang, Li, et al.
Publicado: (2026)
por: Zhang, Li, et al.
Publicado: (2026)
SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation
por: Wang, Zihua, et al.
Publicado: (2025)
por: Wang, Zihua, et al.
Publicado: (2025)
Protect-Your-IP: Scalable Source-Tracing and Attribution against Personalized Generation
por: Li, Runyi, et al.
Publicado: (2024)
por: Li, Runyi, et al.
Publicado: (2024)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
por: Zhao, Heng, et al.
Publicado: (2026)
por: Zhao, Heng, et al.
Publicado: (2026)
Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification
por: Luo, Xiaoliu, et al.
Publicado: (2026)
por: Luo, Xiaoliu, et al.
Publicado: (2026)
MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection
por: Hu, Mengxue, et al.
Publicado: (2025)
por: Hu, Mengxue, et al.
Publicado: (2025)
MedCoT: Medical Chain of Thought via Hierarchical Expert
por: Liu, Jiaxiang, et al.
Publicado: (2024)
por: Liu, Jiaxiang, et al.
Publicado: (2024)
MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models
por: Zhou, Xunlan, et al.
Publicado: (2026)
por: Zhou, Xunlan, et al.
Publicado: (2026)
All-in-One Slider for Attribute Manipulation in Diffusion Models
por: Ye, Weixin, et al.
Publicado: (2025)
por: Ye, Weixin, et al.
Publicado: (2025)
CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level Manner
por: Yan, Tingbing, et al.
Publicado: (2024)
por: Yan, Tingbing, et al.
Publicado: (2024)
Video Set Distillation: Information Diversification and Temporal Densification
por: Zhao, Yinjie, et al.
Publicado: (2024)
por: Zhao, Yinjie, et al.
Publicado: (2024)
Reinforcement-Guided Synthetic Data Generation for Privacy-Sensitive Identity Recognition
por: Jia, Xuemei, et al.
Publicado: (2026)
por: Jia, Xuemei, et al.
Publicado: (2026)
IncreFA: Breaking the Static Wall of Generative Model Attribution
por: Qin, Haotian, et al.
Publicado: (2026)
por: Qin, Haotian, et al.
Publicado: (2026)
Mamba as a Bridge: Where Vision Foundation Models Meet Vision Language Models for Domain-Generalized Semantic Segmentation
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
A Concise but High-performing Network for Image Guided Depth Completion in Autonomous Driving
por: Liu, Moyun, et al.
Publicado: (2024)
por: Liu, Moyun, et al.
Publicado: (2024)
SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens
por: Zhang, Xiaoyan, et al.
Publicado: (2026)
por: Zhang, Xiaoyan, et al.
Publicado: (2026)
Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models
por: Xiong, Lexiang, et al.
Publicado: (2026)
por: Xiong, Lexiang, et al.
Publicado: (2026)
Will the Inclusion of Generated Data Amplify Bias Across Generations in Future Image Classification Models?
por: Zhang, Zeliang, et al.
Publicado: (2024)
por: Zhang, Zeliang, et al.
Publicado: (2024)
Ejemplares similares
-
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
por: Huang, Jing, et al.
Publicado: (2025) -
AEGIS: Authenticity Evaluation Benchmark for AI-Generated Video Sequences
por: Li, Jieyu, et al.
Publicado: (2025) -
Evolution-aware VAriance (EVA) Coreset Selection for Medical Image Classification
por: Hong, Yuxin, et al.
Publicado: (2024) -
Evolving from Single-modal to Multi-modal Facial Deepfake Detection: Progress and Challenges
por: Liu, Ping, et al.
Publicado: (2024) -
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
por: Hu, Juncheng, et al.
Publicado: (2026)