ProCap: Projection-Aware Captioning for Spatial Augmented Reality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Zimo, Deng, Yuchen, Ling, Haibin, Huang, Bingyao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
par: Deng, Yuchen, et autres
Publié: (2025)
par: Deng, Yuchen, et autres
Publié: (2025)
GS-ProCams: Gaussian Splatting-based Projector-Camera Systems
par: Deng, Qingyue, et autres
Publié: (2024)
par: Deng, Qingyue, et autres
Publié: (2024)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
par: Sukhani, Siddhant, et autres
Publié: (2025)
par: Sukhani, Siddhant, et autres
Publié: (2025)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
par: Cui, Can, et autres
Publié: (2024)
par: Cui, Can, et autres
Publié: (2024)
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024)
par: Hu, Erdong, et autres
Publié: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
par: Zi, Xing, et autres
Publié: (2025)
par: Zi, Xing, et autres
Publié: (2025)
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
par: Wang, Jiuniu, et autres
Publié: (2025)
par: Wang, Jiuniu, et autres
Publié: (2025)
Spatial-Aware Efficient Projector for MLLMs via Multi-Layer Feature Aggregation
par: Qian, Shun, et autres
Publié: (2024)
par: Qian, Shun, et autres
Publié: (2024)
Video Summarization: Towards Entity-Aware Captions
par: Ayyubi, Hammad A., et autres
Publié: (2023)
par: Ayyubi, Hammad A., et autres
Publié: (2023)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
par: Sun, Qianqian, et autres
Publié: (2025)
par: Sun, Qianqian, et autres
Publié: (2025)
MotionPro: A Precise Motion Controller for Image-to-Video Generation
par: Zhang, Zhongwei, et autres
Publié: (2025)
par: Zhang, Zhongwei, et autres
Publié: (2025)
Mesquite MoCap: Democratizing Real-Time Motion Capture with Affordable, Bodyworn IoT Sensors and WebXR SLAM
par: Vanani, Poojan, et autres
Publié: (2025)
par: Vanani, Poojan, et autres
Publié: (2025)
MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt
par: Wang, Yuhao, et autres
Publié: (2024)
par: Wang, Yuhao, et autres
Publié: (2024)
Generating Attribute-Aware Human Motions from Textual Prompt
par: Wang, Xinghan, et autres
Publié: (2025)
par: Wang, Xinghan, et autres
Publié: (2025)
Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
par: Mao, Yuxin, et autres
Publié: (2025)
par: Mao, Yuxin, et autres
Publié: (2025)
IG Captioner: Information Gain Captioners are Strong Zero-shot Classifiers
par: Yang, Chenglin, et autres
Publié: (2023)
par: Yang, Chenglin, et autres
Publié: (2023)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
par: Chen, Yijing, et autres
Publié: (2025)
par: Chen, Yijing, et autres
Publié: (2025)
2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
Spatial-Temporal Human-Object Interaction Detection
par: Sun, Xu, et autres
Publié: (2025)
par: Sun, Xu, et autres
Publié: (2025)
IWN: Image Watermarking Based on Idempotency
par: Deng, Kaixin
Publié: (2024)
par: Deng, Kaixin
Publié: (2024)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
Selective Vision-Language Subspace Projection for Few-shot CLIP
par: Zhu, Xingyu, et autres
Publié: (2024)
par: Zhu, Xingyu, et autres
Publié: (2024)
LiftProj: Space Lifting and Projection-Based Panorama Stitching
par: Jia, Yuan, et autres
Publié: (2025)
par: Jia, Yuan, et autres
Publié: (2025)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
par: Zhu, Xilei, et autres
Publié: (2024)
par: Zhu, Xilei, et autres
Publié: (2024)
Visual Lifelog Retrieval through Captioning-Enhanced Interpretation
par: Shih, Yu-Fei, et autres
Publié: (2025)
par: Shih, Yu-Fei, et autres
Publié: (2025)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
par: Mao, Junzhu, et autres
Publié: (2025)
par: Mao, Junzhu, et autres
Publié: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
par: Liu, Jingping, et autres
Publié: (2025)
par: Liu, Jingping, et autres
Publié: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
Cross Modification Attention Based Deliberation Model for Image Captioning
par: Lian, Zheng, et autres
Publié: (2021)
par: Lian, Zheng, et autres
Publié: (2021)
MoRAG -- Multi-Fusion Retrieval Augmented Generation for Human Motion
par: Kalakonda, Sai Shashank, et autres
Publié: (2024)
par: Kalakonda, Sai Shashank, et autres
Publié: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
par: Zhu, Yixin, et autres
Publié: (2026)
par: Zhu, Yixin, et autres
Publié: (2026)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
Documents similaires
-
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
par: Deng, Yuchen, et autres
Publié: (2025) -
GS-ProCams: Gaussian Splatting-based Projector-Camera Systems
par: Deng, Qingyue, et autres
Publié: (2024) -
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024) -
FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
par: Sukhani, Siddhant, et autres
Publié: (2025) -
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
par: Zhu, Xilei, et autres
Publié: (2024)