TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Ce, Ren, Yi, Li, Yuanming, Goriachko, Viktor, Ye, Zhenhui, Guo, Zujin, Hong, Zhibin, Gong, Mingming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generate Your Talking Avatar from Video Reference
por: Guo, Zujin, et al.
Publicado: (2026)
por: Guo, Zujin, et al.
Publicado: (2026)
Navigation with VLM framework: Towards Going to Any Language
por: Yin, Zecheng, et al.
Publicado: (2024)
por: Yin, Zecheng, et al.
Publicado: (2024)
Depth Any Camera: Zero-Shot Metric Depth Estimation from Any Camera
por: Guo, Yuliang, et al.
Publicado: (2025)
por: Guo, Yuliang, et al.
Publicado: (2025)
TinyVLM: Zero-Shot Object Detection on Microcontrollers via Vision-Language Distillation with Matryoshka Embeddings
por: Wilson, Bibin
Publicado: (2026)
por: Wilson, Bibin
Publicado: (2026)
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
por: Zhang, Ce, et al.
Publicado: (2024)
por: Zhang, Ce, et al.
Publicado: (2024)
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
por: Danish, Muhammad Sohail, et al.
Publicado: (2024)
por: Danish, Muhammad Sohail, et al.
Publicado: (2024)
MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations
por: Wu, Jiang, et al.
Publicado: (2025)
por: Wu, Jiang, et al.
Publicado: (2025)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
por: Li, Juncheng, et al.
Publicado: (2025)
por: Li, Juncheng, et al.
Publicado: (2025)
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning
por: Liu, Jiajin, et al.
Publicado: (2026)
por: Liu, Jiajin, et al.
Publicado: (2026)
ContextVLM: Zero-Shot and Few-Shot Context Understanding for Autonomous Driving using Vision Language Models
por: Sural, Shounak, et al.
Publicado: (2024)
por: Sural, Shounak, et al.
Publicado: (2024)
AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLM
por: Ahn, Sunghyun, et al.
Publicado: (2025)
por: Ahn, Sunghyun, et al.
Publicado: (2025)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
por: Saxena, Rohit, et al.
Publicado: (2026)
por: Saxena, Rohit, et al.
Publicado: (2026)
Exosomes: From Non‐Invasive Detection to Engineered Targeted Therapy
por: Mingming Sun, et al.
Publicado: (2026)
por: Mingming Sun, et al.
Publicado: (2026)
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks
por: Guo, Jingyu, et al.
Publicado: (2026)
por: Guo, Jingyu, et al.
Publicado: (2026)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
por: Chen, Pingyi, et al.
Publicado: (2025)
por: Chen, Pingyi, et al.
Publicado: (2025)
Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models
por: Wang, Hengfei, et al.
Publicado: (2026)
por: Wang, Hengfei, et al.
Publicado: (2026)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
AnyTrans: Translate AnyText in the Image with Large Scale Models
por: Qian, Zhipeng, et al.
Publicado: (2024)
por: Qian, Zhipeng, et al.
Publicado: (2024)
TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model
por: Li, Ao, et al.
Publicado: (2025)
por: Li, Ao, et al.
Publicado: (2025)
VLM-RRT: Vision Language Model Guided RRT Search for Autonomous UAV Navigation
por: Ye, Jianlin, et al.
Publicado: (2025)
por: Ye, Jianlin, et al.
Publicado: (2025)
AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement
por: Hu, Zhaofeng, et al.
Publicado: (2026)
por: Hu, Zhaofeng, et al.
Publicado: (2026)
AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models
por: Heo, Hyeongjun, et al.
Publicado: (2026)
por: Heo, Hyeongjun, et al.
Publicado: (2026)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
por: Xu, Zhenlin, et al.
Publicado: (2023)
por: Xu, Zhenlin, et al.
Publicado: (2023)
Lite Any Stereo: Efficient Zero-Shot Stereo Matching
por: Jing, Junpeng, et al.
Publicado: (2025)
por: Jing, Junpeng, et al.
Publicado: (2025)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence
por: Zeng, Zhitao, et al.
Publicado: (2025)
por: Zeng, Zhitao, et al.
Publicado: (2025)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
por: Li, Yuliang, et al.
Publicado: (2026)
por: Li, Yuliang, et al.
Publicado: (2026)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
ScVLM: Enhancing Vision-Language Model for Safety-Critical Event Understanding
por: Shi, Liang, et al.
Publicado: (2024)
por: Shi, Liang, et al.
Publicado: (2024)
VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models
por: Hyeon-Woo, Nam, et al.
Publicado: (2024)
por: Hyeon-Woo, Nam, et al.
Publicado: (2024)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning
por: Li, Wenhao, et al.
Publicado: (2026)
por: Li, Wenhao, et al.
Publicado: (2026)
ArtVLM: Attribute Recognition Through Vision-Based Prefix Language Modeling
por: Zhu, William Yicheng, et al.
Publicado: (2024)
por: Zhu, William Yicheng, et al.
Publicado: (2024)
ResBench: Benchmarking LLM-Generated FPGA Designs with Resource Awareness
por: Guo, Ce, et al.
Publicado: (2025)
por: Guo, Ce, et al.
Publicado: (2025)
H2VLR: Heterogeneous Hypergraph Vision-Language Reasoning for Few-Shot Anomaly Detection
por: Huang, Jianghong, et al.
Publicado: (2026)
por: Huang, Jianghong, et al.
Publicado: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
por: Huang, Zhipeng, et al.
Publicado: (2024)
por: Huang, Zhipeng, et al.
Publicado: (2024)
Knowledge Visualization: A Benchmark and Method for Knowledge-Intensive Text-to-Image Generation
por: Zhao, Ran, et al.
Publicado: (2026)
por: Zhao, Ran, et al.
Publicado: (2026)
DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory
por: Ji, Zihe, et al.
Publicado: (2025)
por: Ji, Zihe, et al.
Publicado: (2025)
VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning
por: Li, Wenhao, et al.
Publicado: (2025)
por: Li, Wenhao, et al.
Publicado: (2025)
Ejemplares similares
-
Generate Your Talking Avatar from Video Reference
por: Guo, Zujin, et al.
Publicado: (2026) -
Navigation with VLM framework: Towards Going to Any Language
por: Yin, Zecheng, et al.
Publicado: (2024) -
Depth Any Camera: Zero-Shot Metric Depth Estimation from Any Camera
por: Guo, Yuliang, et al.
Publicado: (2025) -
TinyVLM: Zero-Shot Object Detection on Microcontrollers via Vision-Language Distillation with Matryoshka Embeddings
por: Wilson, Bibin
Publicado: (2026) -
Enhancing Vision-Language Few-Shot Adaptation with Negative Learning
por: Zhang, Ce, et al.
Publicado: (2024)