ViLCo-Bench: VIdeo Language COntinual learning Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Tianqi, Deldari, Shohreh, Xue, Hao, De Melo, Celso, Salim, Flora D. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bisecle: Binding and Separation in Continual Learning for Video Language Understanding
por: Tan, Yue, et al.
Publicado: (2025)
por: Tan, Yue, et al.
Publicado: (2025)
HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding
por: Nguyen, Toan, et al.
Publicado: (2026)
por: Nguyen, Toan, et al.
Publicado: (2026)
HiT-JEPA: A Hierarchical Self-supervised Trajectory Embedding Framework for Similarity Computation
por: Li, Lihuan, et al.
Publicado: (2025)
por: Li, Lihuan, et al.
Publicado: (2025)
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
por: Yin, Tengjiao, et al.
Publicado: (2026)
por: Yin, Tengjiao, et al.
Publicado: (2026)
Leveraging Swin Transformer for Local-to-Global Weakly Supervised Semantic Segmentation
por: Ahmadi, Rozhan, et al.
Publicado: (2024)
por: Ahmadi, Rozhan, et al.
Publicado: (2024)
AHA -- Predicting What Matters Next: Online Highlight Detection Without Looking Ahead
por: Chang, Aiden, et al.
Publicado: (2025)
por: Chang, Aiden, et al.
Publicado: (2025)
Resolution-Agnostic Transformer-based Climate Downscaling
por: Curran, Declan, et al.
Publicado: (2024)
por: Curran, Declan, et al.
Publicado: (2024)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
por: Xue, Kaiwen, et al.
Publicado: (2026)
por: Xue, Kaiwen, et al.
Publicado: (2026)
COMODO: Cross-Modal Video-to-IMU Distillation for Efficient Egocentric Human Activity Recognition
por: Chen, Baiyu, et al.
Publicado: (2025)
por: Chen, Baiyu, et al.
Publicado: (2025)
μ-Bench: A Vision-Language Benchmark for Microscopy Understanding
por: Lozano, Alejandro, et al.
Publicado: (2024)
por: Lozano, Alejandro, et al.
Publicado: (2024)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
por: Zhuang, Cailin, et al.
Publicado: (2025)
por: Zhuang, Cailin, et al.
Publicado: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
por: Ouyang, Kun, et al.
Publicado: (2024)
por: Ouyang, Kun, et al.
Publicado: (2024)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
por: Kong, Fanqi, et al.
Publicado: (2025)
por: Kong, Fanqi, et al.
Publicado: (2025)
F-ViTA: Foundation Model Guided Visible to Thermal Translation
por: Paranjape, Jay N., et al.
Publicado: (2025)
por: Paranjape, Jay N., et al.
Publicado: (2025)
ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
por: Li, Zechen, et al.
Publicado: (2025)
por: Li, Zechen, et al.
Publicado: (2025)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
por: Luo, Zhiming, et al.
Publicado: (2026)
por: Luo, Zhiming, et al.
Publicado: (2026)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
por: Yuan, Botai, et al.
Publicado: (2025)
por: Yuan, Botai, et al.
Publicado: (2025)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
por: Wang, Zhecan, et al.
Publicado: (2024)
por: Wang, Zhecan, et al.
Publicado: (2024)
LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding
por: Wang, Xiaodong, et al.
Publicado: (2026)
por: Wang, Xiaodong, et al.
Publicado: (2026)
Multi-task Learning for Joint Re-identification, Team Affiliation, and Role Classification for Sports Visual Tracking
por: Mansourian, Amir M., et al.
Publicado: (2024)
por: Mansourian, Amir M., et al.
Publicado: (2024)
CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning
por: Liu, Yang, et al.
Publicado: (2026)
por: Liu, Yang, et al.
Publicado: (2026)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
por: Zhou, Yutong, et al.
Publicado: (2024)
por: Zhou, Yutong, et al.
Publicado: (2024)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
por: Saxena, Rohit, et al.
Publicado: (2026)
por: Saxena, Rohit, et al.
Publicado: (2026)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
por: Wang, JiYang, et al.
Publicado: (2026)
por: Wang, JiYang, et al.
Publicado: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
por: Bao, Han, et al.
Publicado: (2024)
por: Bao, Han, et al.
Publicado: (2024)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
por: Gao, Tianyi, et al.
Publicado: (2025)
por: Gao, Tianyi, et al.
Publicado: (2025)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
SensorLLM: Aligning Large Language Models with Motion Sensors for Human Activity Recognition
por: Li, Zechen, et al.
Publicado: (2024)
por: Li, Zechen, et al.
Publicado: (2024)
Generate the Forest before the Trees -- A Hierarchical Diffusion model for Climate Downscaling
por: Curran, Declan J., et al.
Publicado: (2025)
por: Curran, Declan J., et al.
Publicado: (2025)
PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models
por: Guang, Jiahui, et al.
Publicado: (2026)
por: Guang, Jiahui, et al.
Publicado: (2026)
SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals
por: Lin, Zihang, et al.
Publicado: (2026)
por: Lin, Zihang, et al.
Publicado: (2026)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
por: Wang, Sibo, et al.
Publicado: (2024)
por: Wang, Sibo, et al.
Publicado: (2024)
SeqBench: Benchmarking Sequential Narrative Generation in Text-to-Video Models
por: Tang, Zhengxu, et al.
Publicado: (2025)
por: Tang, Zhengxu, et al.
Publicado: (2025)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
por: Li, Hanzheng, et al.
Publicado: (2025)
por: Li, Hanzheng, et al.
Publicado: (2025)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
por: Han, Haonan, et al.
Publicado: (2026)
por: Han, Haonan, et al.
Publicado: (2026)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
por: Chen, Harold Haodong, et al.
Publicado: (2025)
por: Chen, Harold Haodong, et al.
Publicado: (2025)
SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation
por: Wu, Aodi, et al.
Publicado: (2026)
por: Wu, Aodi, et al.
Publicado: (2026)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
por: Rawte, Vipula, et al.
Publicado: (2024)
por: Rawte, Vipula, et al.
Publicado: (2024)
Ejemplares similares
-
Bisecle: Binding and Separation in Continual Learning for Video Language Understanding
por: Tan, Yue, et al.
Publicado: (2025) -
HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding
por: Nguyen, Toan, et al.
Publicado: (2026) -
HiT-JEPA: A Hierarchical Self-supervised Trajectory Embedding Framework for Similarity Computation
por: Li, Lihuan, et al.
Publicado: (2025) -
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
por: Yin, Tengjiao, et al.
Publicado: (2026) -
Leveraging Swin Transformer for Local-to-Global Weakly Supervised Semantic Segmentation
por: Ahmadi, Rozhan, et al.
Publicado: (2024)