SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
Fuente:
arXiv
Guardado en:
| Autores principales: | Du, Hao, Wu, Bo, Lu, Yan, Mao, Zhendong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation
por: Du, Yuxuan, et al.
Publicado: (2025)
por: Du, Yuxuan, et al.
Publicado: (2025)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
por: Lin, Yijing, et al.
Publicado: (2025)
por: Lin, Yijing, et al.
Publicado: (2025)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
Video-Language Alignment via Spatio-Temporal Graph Transformer
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
por: Zhang, Shi-Xue, et al.
Publicado: (2024)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
por: Souza, Rafael, et al.
Publicado: (2024)
por: Souza, Rafael, et al.
Publicado: (2024)
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
por: Jiang, Songtao, et al.
Publicado: (2026)
por: Jiang, Songtao, et al.
Publicado: (2026)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
por: Wu, Bo, et al.
Publicado: (2024)
por: Wu, Bo, et al.
Publicado: (2024)
Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video
por: Benschop, Pascal, et al.
Publicado: (2026)
por: Benschop, Pascal, et al.
Publicado: (2026)
Gradual Residuals Alignment: A Dual-Stream Framework for GAN Inversion and Image Attribute Editing
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Match Stereo Videos via Bidirectional Alignment
por: Jing, Junpeng, et al.
Publicado: (2024)
por: Jing, Junpeng, et al.
Publicado: (2024)
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
por: Wu, Yuanchen, et al.
Publicado: (2025)
por: Wu, Yuanchen, et al.
Publicado: (2025)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
por: Shi, Jiapeng, et al.
Publicado: (2026)
por: Shi, Jiapeng, et al.
Publicado: (2026)
Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models
por: Xia, Hou, et al.
Publicado: (2025)
por: Xia, Hou, et al.
Publicado: (2025)
Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos
por: Zhao, Zecheng, et al.
Publicado: (2025)
por: Zhao, Zecheng, et al.
Publicado: (2025)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Vision-Language Models Assisted Unsupervised Video Anomaly Detection
por: Jiang, Yalong, et al.
Publicado: (2024)
por: Jiang, Yalong, et al.
Publicado: (2024)
Everything to the Synthetic: Diffusion-driven Test-time Adaptation via Synthetic-Domain Alignment
por: Guo, Jiayi, et al.
Publicado: (2024)
por: Guo, Jiayi, et al.
Publicado: (2024)
Synth-Align: Improving Trustworthiness in Vision-Language Model with Synthetic Preference Data Alignment
por: Wijaya, Robert, et al.
Publicado: (2024)
por: Wijaya, Robert, et al.
Publicado: (2024)
Static and Dynamic Graph Alignment Network for Temporal Video Grounding
por: Hu, Zhanjie, et al.
Publicado: (2026)
por: Hu, Zhanjie, et al.
Publicado: (2026)
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
por: Cao, Bin, et al.
Publicado: (2024)
por: Cao, Bin, et al.
Publicado: (2024)
Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives
por: Park, Ji-jun, et al.
Publicado: (2024)
por: Park, Ji-jun, et al.
Publicado: (2024)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
por: Tu, Xuezhen, et al.
Publicado: (2026)
por: Tu, Xuezhen, et al.
Publicado: (2026)
Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation
por: Fang, Hao, et al.
Publicado: (2024)
por: Fang, Hao, et al.
Publicado: (2024)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
por: Shen, Leqi, et al.
Publicado: (2025)
por: Shen, Leqi, et al.
Publicado: (2025)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025)
por: Yang, Zhenyu, et al.
Publicado: (2025)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
por: Wang, Andong, et al.
Publicado: (2024)
por: Wang, Andong, et al.
Publicado: (2024)
Predictive Temporal Attention on Event-based Video Stream for Energy-efficient Situation Awareness
por: Bu, Yiming, et al.
Publicado: (2024)
por: Bu, Yiming, et al.
Publicado: (2024)
Temporal Prototyping and Hierarchical Alignment for Unsupervised Video-based Visible-Infrared Person Re-Identification
por: Li, Zhiyong, et al.
Publicado: (2026)
por: Li, Zhiyong, et al.
Publicado: (2026)
CELLO: Causal Evaluation of Large Vision-Language Models
por: Chen, Meiqi, et al.
Publicado: (2024)
por: Chen, Meiqi, et al.
Publicado: (2024)
MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models
por: Xu, Wenbo, et al.
Publicado: (2026)
por: Xu, Wenbo, et al.
Publicado: (2026)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
por: Shu, Yan, et al.
Publicado: (2024)
por: Shu, Yan, et al.
Publicado: (2024)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
CAS-IQA: Teaching Vision-Language Models for Synthetic Angiography Quality Assessment
por: Wang, Bo, et al.
Publicado: (2025)
por: Wang, Bo, et al.
Publicado: (2025)
Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos
por: Tran, Tuyen, et al.
Publicado: (2025)
por: Tran, Tuyen, et al.
Publicado: (2025)
Modest-Align: Data-Efficient Alignment for Vision-Language Models
por: Liu, Jiaxiang, et al.
Publicado: (2025)
por: Liu, Jiaxiang, et al.
Publicado: (2025)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
por: Ma, Xiaochen, et al.
Publicado: (2023)
por: Ma, Xiaochen, et al.
Publicado: (2023)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
por: Wu, Bin, et al.
Publicado: (2026)
por: Wu, Bin, et al.
Publicado: (2026)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
por: Sugandhika, Chinthani, et al.
Publicado: (2025)
Ejemplares similares
-
CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation
por: Du, Yuxuan, et al.
Publicado: (2025) -
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
por: Fei, Hao, et al.
Publicado: (2024) -
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
por: Lin, Yijing, et al.
Publicado: (2025) -
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024) -
Video-Language Alignment via Spatio-Temporal Graph Transformer
por: Zhang, Shi-Xue, et al.
Publicado: (2024)