Artemis: Towards Referential Understanding in Complex Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Jihao, Zhang, Yuan, Tang, Xi, Xie, Lingxi, Ma, Tianren, Yan, Pengyu, Doermann, David, Ye, Qixiang, Tian, Yunjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
di: Ma, Tianren, et al.
Pubblicazione: (2024)
di: Ma, Tianren, et al.
Pubblicazione: (2024)
Adaptive Keyframe Sampling for Long Video Understanding
di: Tang, Xi, et al.
Pubblicazione: (2025)
di: Tang, Xi, et al.
Pubblicazione: (2025)
ChatterBox: Multi-round Multimodal Referring and Grounding
di: Tian, Yunjie, et al.
Pubblicazione: (2024)
di: Tian, Yunjie, et al.
Pubblicazione: (2024)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
YOLOv12: Attention-Centric Real-Time Object Detectors
di: Tian, Yunjie, et al.
Pubblicazione: (2025)
di: Tian, Yunjie, et al.
Pubblicazione: (2025)
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
di: Tian, Yunjie, et al.
Pubblicazione: (2022)
di: Tian, Yunjie, et al.
Pubblicazione: (2022)
TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation
di: Yan, Pengyu, et al.
Pubblicazione: (2026)
di: Yan, Pengyu, et al.
Pubblicazione: (2026)
Personalized Large Vision-Language Models
di: Pham, Chau, et al.
Pubblicazione: (2024)
di: Pham, Chau, et al.
Pubblicazione: (2024)
AceTone: Bridging Words and Colors for Conditional Image Grading
di: Ma, Tianren, et al.
Pubblicazione: (2026)
di: Ma, Tianren, et al.
Pubblicazione: (2026)
Spatial Transform Decoupling for Oriented Object Detection
di: Yu, Hongtian, et al.
Pubblicazione: (2023)
di: Yu, Hongtian, et al.
Pubblicazione: (2023)
VMamba: Visual State Space Model
di: Liu, Yue, et al.
Pubblicazione: (2024)
di: Liu, Yue, et al.
Pubblicazione: (2024)
ReDDiT: Rehashing Noise for Discrete Visual Generation
di: Ma, Tianren, et al.
Pubblicazione: (2025)
di: Ma, Tianren, et al.
Pubblicazione: (2025)
CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
ChartReformer: Natural Language-Driven Chart Image Editing
di: Yan, Pengyu, et al.
Pubblicazione: (2024)
di: Yan, Pengyu, et al.
Pubblicazione: (2024)
AutoEdit: Automatic Hyperparameter Tuning for Image Editing
di: Pham, Chau, et al.
Pubblicazione: (2025)
di: Pham, Chau, et al.
Pubblicazione: (2025)
SAMA: Towards Multi-Turn Referential Grounded Video Chat with Large Language Models
di: Sun, Ye, et al.
Pubblicazione: (2025)
di: Sun, Ye, et al.
Pubblicazione: (2025)
PathDiff: Histopathology Image Synthesis with Unpaired Text and Mask Conditions
di: Bhosale, Mahesh, et al.
Pubblicazione: (2025)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2025)
VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning
di: Zhu, Liyun, et al.
Pubblicazione: (2025)
di: Zhu, Liyun, et al.
Pubblicazione: (2025)
Building Vision Models upon Heat Conduction
di: Wang, Zhaozhi, et al.
Pubblicazione: (2024)
di: Wang, Zhaozhi, et al.
Pubblicazione: (2024)
Artemis: Structured Visual Reasoning for Perception Policy Learning
di: Tang, Wei, et al.
Pubblicazione: (2025)
di: Tang, Wei, et al.
Pubblicazione: (2025)
Artemis: Articulated Neural Pets with Appearance and Motion synthesis
di: Luo, Haimin, et al.
Pubblicazione: (2022)
di: Luo, Haimin, et al.
Pubblicazione: (2022)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
Text-guided Fine-Grained Video Anomaly Understanding
di: Gu, Jihao, et al.
Pubblicazione: (2025)
di: Gu, Jihao, et al.
Pubblicazione: (2025)
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
di: He, Xin, et al.
Pubblicazione: (2025)
di: He, Xin, et al.
Pubblicazione: (2025)
Text-Animator: Controllable Visual Text Video Generation
di: Liu, Lin, et al.
Pubblicazione: (2024)
di: Liu, Lin, et al.
Pubblicazione: (2024)
Delving Deep into Semantic Relation Distillation
di: Yan, Zhaoyi, et al.
Pubblicazione: (2025)
di: Yan, Zhaoyi, et al.
Pubblicazione: (2025)
EventRR: Event Referential Reasoning for Referring Video Object Segmentation
di: Xu, Huihui, et al.
Pubblicazione: (2025)
di: Xu, Huihui, et al.
Pubblicazione: (2025)
Towards Universal Soccer Video Understanding
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
di: Rao, Jiayuan, et al.
Pubblicazione: (2024)
AdsQA: Towards Advertisement Video Understanding
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
di: He, Xin, et al.
Pubblicazione: (2024)
di: He, Xin, et al.
Pubblicazione: (2024)
Study on Aspect Ratio Variability toward Robustness of Vision Transformer-based Vehicle Re-identification
di: Qiu, Mei, et al.
Pubblicazione: (2024)
di: Qiu, Mei, et al.
Pubblicazione: (2024)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
di: wang, Shuo, et al.
Pubblicazione: (2025)
di: wang, Shuo, et al.
Pubblicazione: (2025)
MA-Bench: Towards Fine-grained Micro-Action Understanding
di: Li, Kun, et al.
Pubblicazione: (2026)
di: Li, Kun, et al.
Pubblicazione: (2026)
Leaf-Based Plant Disease Detection and Explainable AI
di: Sagar, Saurav, et al.
Pubblicazione: (2023)
di: Sagar, Saurav, et al.
Pubblicazione: (2023)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
di: Zhai, Yuanhao, et al.
Pubblicazione: (2024)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
Expandable Residual Approximation for Knowledge Distillation
di: Yan, Zhaoyi, et al.
Pubblicazione: (2025)
di: Yan, Zhaoyi, et al.
Pubblicazione: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
di: Zhang, Xingjian, et al.
Pubblicazione: (2025)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
di: Wang, Zhaozhi, et al.
Pubblicazione: (2025)
di: Wang, Zhaozhi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
di: Ma, Tianren, et al.
Pubblicazione: (2024) -
Adaptive Keyframe Sampling for Long Video Understanding
di: Tang, Xi, et al.
Pubblicazione: (2025) -
ChatterBox: Multi-round Multimodal Referring and Grounding
di: Tian, Yunjie, et al.
Pubblicazione: (2024) -
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
di: Qiu, Jihao, et al.
Pubblicazione: (2026) -
YOLOv12: Attention-Centric Real-Time Object Detectors
di: Tian, Yunjie, et al.
Pubblicazione: (2025)