SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Ye, Zhang, Hao, Ding, Henghui, Zhang, Tiehua, Ma, Xingjun, Jiang, Yu-Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UnSeg: One Universal Unlearnable Example Generator is Enough against All Image Segmentation
di: Sun, Ye, et al.
Pubblicazione: (2024)
di: Sun, Ye, et al.
Pubblicazione: (2024)
DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
di: Sun, Ye, et al.
Pubblicazione: (2026)
di: Sun, Ye, et al.
Pubblicazione: (2026)
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
di: Mou, Tingshu, et al.
Pubblicazione: (2026)
di: Mou, Tingshu, et al.
Pubblicazione: (2026)
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
di: Shuai, Xincheng, et al.
Pubblicazione: (2024)
di: Shuai, Xincheng, et al.
Pubblicazione: (2024)
Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation
di: Shuai, Xincheng, et al.
Pubblicazione: (2025)
di: Shuai, Xincheng, et al.
Pubblicazione: (2025)
Artemis: Towards Referential Understanding in Complex Videos
di: Qiu, Jihao, et al.
Pubblicazione: (2024)
di: Qiu, Jihao, et al.
Pubblicazione: (2024)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
di: Ying, Kaining, et al.
Pubblicazione: (2025)
di: Ying, Kaining, et al.
Pubblicazione: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
di: Zhang, Xinyao, et al.
Pubblicazione: (2026)
di: Zhang, Xinyao, et al.
Pubblicazione: (2026)
FedAPT: Federated Adversarial Prompt Tuning for Vision-Language Models
di: Zhai, Kun, et al.
Pubblicazione: (2025)
di: Zhai, Kun, et al.
Pubblicazione: (2025)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
di: Wang, Yixu, et al.
Pubblicazione: (2025)
di: Wang, Yixu, et al.
Pubblicazione: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
SegPoint: Segment Any Point Cloud via Large Language Model
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
Grounding Language in Multi-Perspective Referential Communication
di: Tang, Zineng, et al.
Pubblicazione: (2024)
di: Tang, Zineng, et al.
Pubblicazione: (2024)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
BadPatch: Diffusion-Based Generation of Physical Adversarial Patches
di: Wang, Zhixiang, et al.
Pubblicazione: (2024)
di: Wang, Zhixiang, et al.
Pubblicazione: (2024)
Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
SAM3-DMS: Decoupled Memory Selection for Multi-target Video Segmentation of SAM3
di: Shen, Ruiqi, et al.
Pubblicazione: (2026)
di: Shen, Ruiqi, et al.
Pubblicazione: (2026)
ROSE: Retrieval-Oriented Segmentation Enhancement
di: Tang, Song, et al.
Pubblicazione: (2026)
di: Tang, Song, et al.
Pubblicazione: (2026)
EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery
di: Wang, Guankun, et al.
Pubblicazione: (2025)
di: Wang, Guankun, et al.
Pubblicazione: (2025)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
di: Yue, Tongtian, et al.
Pubblicazione: (2024)
NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
IRef-VLA: A Benchmark for Interactive Referential Grounding with Imperfect Language in 3D Scenes
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
di: Zhang, Haochen, et al.
Pubblicazione: (2025)
AIM: Additional Image Guided Generation of Transferable Adversarial Attacks
di: Li, Teng, et al.
Pubblicazione: (2025)
di: Li, Teng, et al.
Pubblicazione: (2025)
Adversarial Prompt Tuning for Vision-Language Models
di: Zhang, Jiaming, et al.
Pubblicazione: (2023)
di: Zhang, Jiaming, et al.
Pubblicazione: (2023)
GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation
di: Ding, Henghui, et al.
Pubblicazione: (2026)
di: Ding, Henghui, et al.
Pubblicazione: (2026)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
RefMask3D: Language-Guided Transformer for 3D Referring Segmentation
di: He, Shuting, et al.
Pubblicazione: (2024)
di: He, Shuting, et al.
Pubblicazione: (2024)
ChatTracker: Enhancing Visual Tracking Performance via Chatting with Multimodal Large Language Model
di: Sun, Yiming, et al.
Pubblicazione: (2024)
di: Sun, Yiming, et al.
Pubblicazione: (2024)
Adversarial Prompt Distillation for Vision-Language Models
di: Luo, Lin, et al.
Pubblicazione: (2024)
di: Luo, Lin, et al.
Pubblicazione: (2024)
IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting
di: Fu, Hao, et al.
Pubblicazione: (2025)
di: Fu, Hao, et al.
Pubblicazione: (2025)
Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
di: Choi, In Chong, et al.
Pubblicazione: (2026)
di: Choi, In Chong, et al.
Pubblicazione: (2026)
PixelSmile: Toward Fine-Grained Facial Expression Editing
di: Hua, Jiabin, et al.
Pubblicazione: (2026)
di: Hua, Jiabin, et al.
Pubblicazione: (2026)
MOVE: Motion-Guided Few-Shot Video Object Segmentation
di: Ying, Kaining, et al.
Pubblicazione: (2025)
di: Ying, Kaining, et al.
Pubblicazione: (2025)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
Extracting Training Data from Unconditional Diffusion Models
di: Chen, Yunhao, et al.
Pubblicazione: (2024)
di: Chen, Yunhao, et al.
Pubblicazione: (2024)
TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models
di: Wang, Xin, et al.
Pubblicazione: (2026)
di: Wang, Xin, et al.
Pubblicazione: (2026)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
di: Wang, Ruofan, et al.
Pubblicazione: (2025)
di: Wang, Ruofan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UnSeg: One Universal Unlearnable Example Generator is Enough against All Image Segmentation
di: Sun, Ye, et al.
Pubblicazione: (2024) -
DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
di: Sun, Ye, et al.
Pubblicazione: (2026) -
ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
di: Mou, Tingshu, et al.
Pubblicazione: (2026) -
A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models
di: Shuai, Xincheng, et al.
Pubblicazione: (2024) -
Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation
di: Shuai, Xincheng, et al.
Pubblicazione: (2025)