Multi-Sentence Grounding for Long-term Instructional Video
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zeqian, Chen, Qirui, Han, Tengda, Zhang, Ya, Wang, Yanfeng, Xie, Weidi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
por: Ge, Mingji, et al.
Publicado: (2026)
por: Ge, Mingji, et al.
Publicado: (2026)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
por: Chen, Qirui, et al.
Publicado: (2024)
por: Chen, Qirui, et al.
Publicado: (2024)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025)
por: Li, Zeqian, et al.
Publicado: (2025)
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
por: Xie, Junyu, et al.
Publicado: (2026)
por: Xie, Junyu, et al.
Publicado: (2026)
Grounded Question-Answering in Long Egocentric Videos
por: Di, Shangzhe, et al.
Publicado: (2023)
por: Di, Shangzhe, et al.
Publicado: (2023)
Learning Streaming Video Representation via Multitask Training
por: Yan, Yibin, et al.
Publicado: (2025)
por: Yan, Yibin, et al.
Publicado: (2025)
Contrast-Unity for Partially-Supervised Temporal Sentence Grounding
por: Wang, Haicheng, et al.
Publicado: (2025)
por: Wang, Haicheng, et al.
Publicado: (2025)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
por: Shi, Yudi, et al.
Publicado: (2024)
por: Shi, Yudi, et al.
Publicado: (2024)
Towards Universal Soccer Video Understanding
por: Rao, Jiayuan, et al.
Publicado: (2024)
por: Rao, Jiayuan, et al.
Publicado: (2024)
Multi-Agent System for Comprehensive Soccer Understanding
por: Rao, Jiayuan, et al.
Publicado: (2025)
por: Rao, Jiayuan, et al.
Publicado: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Object-centric Video Question Answering with Visual Grounding and Referring
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
RadGenome-Chest CT: A Grounded Vision-Language Dataset for Chest CT Analysis
por: Zhang, Xiaoman, et al.
Publicado: (2024)
por: Zhang, Xiaoman, et al.
Publicado: (2024)
Character-Centric Understanding of Animated Movies
por: Gui, Zhongrui, et al.
Publicado: (2025)
por: Gui, Zhongrui, et al.
Publicado: (2025)
Zero-shot Composed Text-Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2023)
por: Liu, Yikun, et al.
Publicado: (2023)
Can Visual Foundation Models Achieve Long-term Point Tracking?
por: Aydemir, Görkay, et al.
Publicado: (2024)
por: Aydemir, Görkay, et al.
Publicado: (2024)
Knowledge-enhanced Visual-Language Pretraining for Computational Pathology
por: Zhou, Xiao, et al.
Publicado: (2024)
por: Zhou, Xiao, et al.
Publicado: (2024)
MRGen: Segmentation Data Engine for Underrepresented MRI Modalities
por: Wu, Haoning, et al.
Publicado: (2024)
por: Wu, Haoning, et al.
Publicado: (2024)
AutoAD III: The Prequel -- Back to the Pixels
por: Han, Tengda, et al.
Publicado: (2024)
por: Han, Tengda, et al.
Publicado: (2024)
Efficient Temporal Sentence Grounding in Videos with Multi-Teacher Knowledge Distillation
por: Liang, Renjie, et al.
Publicado: (2023)
por: Liang, Renjie, et al.
Publicado: (2023)
Large-scale Long-tailed Disease Diagnosis on Radiology Images
por: Zheng, Qiaoyu, et al.
Publicado: (2023)
por: Zheng, Qiaoyu, et al.
Publicado: (2023)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
por: Xie, Junyu, et al.
Publicado: (2024)
por: Xie, Junyu, et al.
Publicado: (2024)
Multi-sentence Video Grounding for Long Video Generation
por: Feng, Wei, et al.
Publicado: (2024)
por: Feng, Wei, et al.
Publicado: (2024)
PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining
por: Liang, Cheng, et al.
Publicado: (2026)
por: Liang, Cheng, et al.
Publicado: (2026)
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
por: Wu, Haoning, et al.
Publicado: (2025)
por: Wu, Haoning, et al.
Publicado: (2025)
A Sanity Check on Composed Image Retrieval
por: Liu, Yikun, et al.
Publicado: (2026)
por: Liu, Yikun, et al.
Publicado: (2026)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
por: Shi, Yudi, et al.
Publicado: (2026)
por: Shi, Yudi, et al.
Publicado: (2026)
How Well Can Modern LLMs Act as Agent Cores in Radiology Environments?
por: Zheng, Qiaoyu, et al.
Publicado: (2024)
por: Zheng, Qiaoyu, et al.
Publicado: (2024)
M^3Builder: A Multi-Agent System for Automated Machine Learning in Medical Imaging
por: Feng, Jinghao, et al.
Publicado: (2025)
por: Feng, Jinghao, et al.
Publicado: (2025)
Shot-by-Shot: Film-Grammar-Aware Training-Free Audio Description Generation
por: Xie, Junyu, et al.
Publicado: (2025)
por: Xie, Junyu, et al.
Publicado: (2025)
Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation
por: Suzuki, Rena, et al.
Publicado: (2026)
por: Suzuki, Rena, et al.
Publicado: (2026)
LoRKD: Low-Rank Knowledge Decomposition for Medical Foundation Models
por: Li, Haolin, et al.
Publicado: (2024)
por: Li, Haolin, et al.
Publicado: (2024)
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
por: Fan, Ziqing, et al.
Publicado: (2025)
por: Fan, Ziqing, et al.
Publicado: (2025)
Rethinking Whole-Body CT Image Interpretation: An Abnormality-Centric Approach
por: Zhao, Ziheng, et al.
Publicado: (2025)
por: Zhao, Ziheng, et al.
Publicado: (2025)
AutoRG-Brain: Grounded Report Generation for Brain MRI
por: Lei, Jiayu, et al.
Publicado: (2024)
por: Lei, Jiayu, et al.
Publicado: (2024)
MatchTime: Towards Automatic Soccer Game Commentary Generation
por: Rao, Jiayuan, et al.
Publicado: (2024)
por: Rao, Jiayuan, et al.
Publicado: (2024)
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos
por: Han, Tingting, et al.
Publicado: (2026)
por: Han, Tingting, et al.
Publicado: (2026)
Amodal Ground Truth and Completion in the Wild
por: Zhan, Guanqi, et al.
Publicado: (2023)
por: Zhan, Guanqi, et al.
Publicado: (2023)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
por: Liu, Chang, et al.
Publicado: (2023)
por: Liu, Chang, et al.
Publicado: (2023)
RadIR: A Scalable Framework for Multi-Grained Medical Image Retrieval via Radiology Report Mining
por: Zhang, Tengfei, et al.
Publicado: (2025)
por: Zhang, Tengfei, et al.
Publicado: (2025)
Ejemplares similares
-
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
por: Ge, Mingji, et al.
Publicado: (2026) -
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
por: Chen, Qirui, et al.
Publicado: (2024) -
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
por: Li, Zeqian, et al.
Publicado: (2025) -
GMOS: Grounding Moving Object Segmentation in 3D Space and Time
por: Xie, Junyu, et al.
Publicado: (2026) -
Grounded Question-Answering in Long Egocentric Videos
por: Di, Shangzhe, et al.
Publicado: (2023)