Salvato in:
| Autori principali: | Zhong, Yangyang, Qi, Ji, Yao, Yuan, Luo, Pengxin, Yan, Yunfeng, Qi, Donglian, Liu, Zhiyuan, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2506.04983 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adept: Annotation-Denoising Auxiliary Tasks with Discrete Cosine Transform Map and Keypoint for Human-Centric Pretraining
di: He, Weizhen, et al.
Pubblicazione: (2025)
di: He, Weizhen, et al.
Pubblicazione: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
di: Qi, Ji, et al.
Pubblicazione: (2025)
di: Qi, Ji, et al.
Pubblicazione: (2025)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
di: Jin, Zhe, et al.
Pubblicazione: (2025)
di: Jin, Zhe, et al.
Pubblicazione: (2025)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023)
di: Fei, Hao, et al.
Pubblicazione: (2023)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Universal Scene Graph Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
TextSculptor: Training and Benchmarking Scene Text Editing
di: Lin, Yiheng, et al.
Pubblicazione: (2026)
di: Lin, Yiheng, et al.
Pubblicazione: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
di: Yang, Yiming, et al.
Pubblicazione: (2025)
di: Yang, Yiming, et al.
Pubblicazione: (2025)
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
di: Ni, Zhenliang, et al.
Pubblicazione: (2025)
di: Ni, Zhenliang, et al.
Pubblicazione: (2025)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
Text-Pass Filter: An Efficient Scene Text Detector
di: Yang, Chuang, et al.
Pubblicazione: (2026)
di: Yang, Chuang, et al.
Pubblicazione: (2026)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
di: Chen, Seng Nam, et al.
Pubblicazione: (2026)
di: Chen, Seng Nam, et al.
Pubblicazione: (2026)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
di: Lan, Xing, et al.
Pubblicazione: (2024)
di: Lan, Xing, et al.
Pubblicazione: (2024)
Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
di: Jin, Kaiming, et al.
Pubblicazione: (2026)
di: Jin, Kaiming, et al.
Pubblicazione: (2026)
Towards 3D Molecule-Text Interpretation in Language Models
di: Li, Sihang, et al.
Pubblicazione: (2024)
di: Li, Sihang, et al.
Pubblicazione: (2024)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Vid-SME: Membership Inference Attacks against Large Video Understanding Models
di: Li, Qi, et al.
Pubblicazione: (2025)
di: Li, Qi, et al.
Pubblicazione: (2025)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
DenseScout: Algorithm-System Co-design for Budgeted Tiny Object Selection on Edge Platforms
di: Zhouzhi, Xiong, et al.
Pubblicazione: (2026)
di: Zhouzhi, Xiong, et al.
Pubblicazione: (2026)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
Text-Guided Mixup Towards Long-Tailed Image Categorization
di: Franklin, Richard, et al.
Pubblicazione: (2024)
di: Franklin, Richard, et al.
Pubblicazione: (2024)
OmniVid: A Generative Framework for Universal Video Understanding
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
di: Tzachor, Issar, et al.
Pubblicazione: (2026)
VidHal: Benchmarking Temporal Hallucinations in Vision LLMs
di: Choong, Wey Yeh, et al.
Pubblicazione: (2024)
di: Choong, Wey Yeh, et al.
Pubblicazione: (2024)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
di: Zhou, Ziwei, et al.
Pubblicazione: (2026)
di: Zhou, Ziwei, et al.
Pubblicazione: (2026)
LET-US: Long Event-Text Understanding of Scenes
di: Chen, Rui, et al.
Pubblicazione: (2025)
di: Chen, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adept: Annotation-Denoising Auxiliary Tasks with Discrete Cosine Transform Map and Keypoint for Human-Centric Pretraining
di: He, Weizhen, et al.
Pubblicazione: (2025) -
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
di: Qi, Ji, et al.
Pubblicazione: (2025) -
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024) -
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023) -
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)