Enregistré dans:
| Auteurs principaux: | Lin, Jiajing, Jiang, Shu, Zeng, Qingyuan, Wang, Zhenzhong, Jiang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.13792 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fading the Digital Ink: A Universal Black-Box Attack Framework for 3DGS Watermarking Systems
par: Zeng, Qingyuan, et autres
Publié: (2025)
par: Zeng, Qingyuan, et autres
Publié: (2025)
Cross-Modality Attack Boosted by Gradient-Evolutionary Multiform Optimization
par: Gong, Yunpeng, et autres
Publié: (2024)
par: Gong, Yunpeng, et autres
Publié: (2024)
Phys4DGen: Physics-Compliant 4D Generation with Multi-Material Composition Perception
par: Lin, Jiajing, et autres
Publié: (2024)
par: Lin, Jiajing, et autres
Publié: (2024)
Phy124: Fast Physics-Driven 4D Content Generation from a Single Image
par: Lin, Jiajing, et autres
Publié: (2024)
par: Lin, Jiajing, et autres
Publié: (2024)
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models
par: Zeng, Qingyuan, et autres
Publié: (2024)
par: Zeng, Qingyuan, et autres
Publié: (2024)
Cross-Task Attack: A Self-Supervision Generative Framework Based on Attention Shift
par: Zeng, Qingyuan, et autres
Publié: (2024)
par: Zeng, Qingyuan, et autres
Publié: (2024)
Facial Identity Anonymization via Intrinsic and Extrinsic Attention Distraction
par: Kuang, Zhenzhong, et autres
Publié: (2024)
par: Kuang, Zhenzhong, et autres
Publié: (2024)
NexusSplats: Efficient 3D Gaussian Splatting in the Wild
par: Tang, Yuzhou, et autres
Publié: (2024)
par: Tang, Yuzhou, et autres
Publié: (2024)
Intrinsic Concept Extraction Based on Compositional Interpretability
par: Shi, Hanyu, et autres
Publié: (2026)
par: Shi, Hanyu, et autres
Publié: (2026)
Part Segmentation and Motion Estimation for Articulated Objects with Dynamic 3D Gaussians
par: Chao, Jun-Jee, et autres
Publié: (2025)
par: Chao, Jun-Jee, et autres
Publié: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
par: Gao, Yiling, et autres
Publié: (2026)
par: Gao, Yiling, et autres
Publié: (2026)
Visual Context Window Extension: A New Perspective for Long Video Understanding
par: Wei, Hongchen, et autres
Publié: (2024)
par: Wei, Hongchen, et autres
Publié: (2024)
Solution for OOD-CV UNICORN Challenge 2024 Object Detection Assistance LLM Counting Ability Improvement
par: Chi, Zhouyang, et autres
Publié: (2024)
par: Chi, Zhouyang, et autres
Publié: (2024)
SemPT: Semantic Prompt Tuning for Vision-Language Models
par: Shi, Xiao, et autres
Publié: (2025)
par: Shi, Xiao, et autres
Publié: (2025)
Improving Network Interpretability via Explanation Consistency Evaluation
par: Wu, Hefeng, et autres
Publié: (2024)
par: Wu, Hefeng, et autres
Publié: (2024)
Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval
par: Jiang, Lin, et autres
Publié: (2026)
par: Jiang, Lin, et autres
Publié: (2026)
Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
SSP-GNN: Learning to Track via Bilevel Optimization
par: Golias, Griffin, et autres
Publié: (2024)
par: Golias, Griffin, et autres
Publié: (2024)
MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
par: Zhu, Chunzheng, et autres
Publié: (2026)
par: Zhu, Chunzheng, et autres
Publié: (2026)
Exploring Interpretability for Visual Prompt Tuning with Cross-layer Concepts
par: Wang, Yubin, et autres
Publié: (2025)
par: Wang, Yubin, et autres
Publié: (2025)
Spatial Information Bottleneck for Interpretable Visual Recognition
par: Shu, Kaixiang, et autres
Publié: (2025)
par: Shu, Kaixiang, et autres
Publié: (2025)
The VEP Booster: A Closed-Loop AI System for Visual EEG Biomarker Auto-generation
par: Luo, Junwen, et autres
Publié: (2024)
par: Luo, Junwen, et autres
Publié: (2024)
Dynamic Rank Adaptation for Vision-Language Models
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
Personalized Vision via Visual In-Context Learning
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
TopoGaussian: Inferring Internal Topology Structures from Visual Clues
par: Xiong, Xiaoyu, et autres
Publié: (2025)
par: Xiong, Xiaoyu, et autres
Publié: (2025)
ORXE: Orchestrating Experts for Dynamically Configurable Efficiency
par: Wang, Qingyuan, et autres
Publié: (2025)
par: Wang, Qingyuan, et autres
Publié: (2025)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
par: Li, Zhaoxu, et autres
Publié: (2025)
par: Li, Zhaoxu, et autres
Publié: (2025)
Learning to Infer Unseen Single-/Multi-Attribute-Object Compositions with Graph Networks
par: Chen, Hui, et autres
Publié: (2020)
par: Chen, Hui, et autres
Publié: (2020)
Style Alignment based Dynamic Observation Method for UAV-View Geo-localization
par: Shao, Jie, et autres
Publié: (2024)
par: Shao, Jie, et autres
Publié: (2024)
Camera Pose Refinement via 3D Gaussian Splatting
par: Hao, Lulu, et autres
Publié: (2025)
par: Hao, Lulu, et autres
Publié: (2025)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation
par: Jiang, Wentao, et autres
Publié: (2024)
par: Jiang, Wentao, et autres
Publié: (2024)
Sensing Surface Patches in Volume Rendering for Inferring Signed Distance Functions
par: Jiang, Sijia, et autres
Publié: (2024)
par: Jiang, Sijia, et autres
Publié: (2024)
Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens
par: Jiang, Zhangqi, et autres
Publié: (2024)
par: Jiang, Zhangqi, et autres
Publié: (2024)
Visual Text Meets Low-level Vision: A Comprehensive Survey on Visual Text Processing
par: Shu, Yan, et autres
Publié: (2024)
par: Shu, Yan, et autres
Publié: (2024)
Vision Remember: Recovering Visual Information in Efficient LVLM with Vision Feature Resampling
par: Feng, Ze, et autres
Publié: (2025)
par: Feng, Ze, et autres
Publié: (2025)
Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt Rewriting
par: Chen, Zijie, et autres
Publié: (2023)
par: Chen, Zijie, et autres
Publié: (2023)
Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations
par: Jiang, Nick, et autres
Publié: (2024)
par: Jiang, Nick, et autres
Publié: (2024)
Documents similaires
-
Fading the Digital Ink: A Universal Black-Box Attack Framework for 3DGS Watermarking Systems
par: Zeng, Qingyuan, et autres
Publié: (2025) -
Cross-Modality Attack Boosted by Gradient-Evolutionary Multiform Optimization
par: Gong, Yunpeng, et autres
Publié: (2024) -
Phys4DGen: Physics-Compliant 4D Generation with Multi-Material Composition Perception
par: Lin, Jiajing, et autres
Publié: (2024) -
Phy124: Fast Physics-Driven 4D Content Generation from a Single Image
par: Lin, Jiajing, et autres
Publié: (2024) -
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models
par: Zeng, Qingyuan, et autres
Publié: (2024)