Temporal-Guided Visual Foundation Models for Event-Based Vision
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Ruihao, Cai, Junhong, Leng, Luziwei, Wang, Liuyi, Liu, Chengju, Cheng, Ran, Tang, Yang, Zhou, Pan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2024)
by: Wang, Liuyi, et al.
Published: (2024)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2023)
by: Wang, Liuyi, et al.
Published: (2023)
Towards Scalable and Consistent 3D Editing
by: Xia, Ruihao, et al.
Published: (2025)
by: Xia, Ruihao, et al.
Published: (2025)
Automotive Object Detection via Learning Sparse Events by Spiking Neurons
by: Zhang, Hu, et al.
Published: (2023)
by: Zhang, Hu, et al.
Published: (2023)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2024)
by: Wang, Liuyi, et al.
Published: (2024)
Accurate and Efficient Event-based Semantic Segmentation Using Adaptive Spiking Encoder-Decoder Network
by: Zhang, Rui, et al.
Published: (2023)
by: Zhang, Rui, et al.
Published: (2023)
Vision-and-Language Navigation via Causal Learning
by: Wang, Liuyi, et al.
Published: (2024)
by: Wang, Liuyi, et al.
Published: (2024)
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2023)
by: Wang, Liuyi, et al.
Published: (2023)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
by: He, Zongtao, et al.
Published: (2023)
by: He, Zongtao, et al.
Published: (2023)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
by: Wang, Liuyi, et al.
Published: (2025)
by: Wang, Liuyi, et al.
Published: (2025)
Event-Priori-Based Vision-Language Model for Efficient Visual Understanding
by: Qin, Haotong, et al.
Published: (2025)
by: Qin, Haotong, et al.
Published: (2025)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
by: Fan, Rong, et al.
Published: (2026)
by: Fan, Rong, et al.
Published: (2026)
VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection
by: Qiu, Bo-Cheng, et al.
Published: (2026)
by: Qiu, Bo-Cheng, et al.
Published: (2026)
DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision
by: Zou, Xiandong, et al.
Published: (2025)
by: Zou, Xiandong, et al.
Published: (2025)
Unsupervised Modality Adaptation with Text-to-Image Diffusion Models for Semantic Segmentation
by: Xia, Ruihao, et al.
Published: (2024)
by: Xia, Ruihao, et al.
Published: (2024)
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
by: Sheng, Kai, et al.
Published: (2026)
by: Sheng, Kai, et al.
Published: (2026)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
by: He, Zongtao, et al.
Published: (2025)
by: He, Zongtao, et al.
Published: (2025)
DidSee: Diffusion-Based Depth Completion for Material-Agnostic Robotic Perception and Manipulation
by: Lyu, Wenzhou, et al.
Published: (2025)
by: Lyu, Wenzhou, et al.
Published: (2025)
VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection -- after competition results
by: Qiu, Bo-Cheng, et al.
Published: (2026)
by: Qiu, Bo-Cheng, et al.
Published: (2026)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
by: Zhou, Ziheng, et al.
Published: (2024)
by: Zhou, Ziheng, et al.
Published: (2024)
CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation
by: Lin, Xiao, et al.
Published: (2025)
by: Lin, Xiao, et al.
Published: (2025)
Visual Instruction Pretraining for Domain-Specific Foundation Models
by: Li, Yuxuan, et al.
Published: (2025)
by: Li, Yuxuan, et al.
Published: (2025)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
by: Mao, Qingyang, et al.
Published: (2025)
by: Mao, Qingyang, et al.
Published: (2025)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
by: Xu, Wenhao, et al.
Published: (2025)
by: Xu, Wenhao, et al.
Published: (2025)
Towards Natural Image Matting in the Wild via Real-Scenario Prior
by: Xia, Ruihao, et al.
Published: (2024)
by: Xia, Ruihao, et al.
Published: (2024)
Scaling Dense Event-Stream Pretraining from Visual Foundation Models
by: Chen, Zhiwen, et al.
Published: (2026)
by: Chen, Zhiwen, et al.
Published: (2026)
Vision Language Models Are Not (Yet) Spelling Correctors
by: Liang, Junhong, et al.
Published: (2025)
by: Liang, Junhong, et al.
Published: (2025)
Towards Vision-Language Geo-Foundation Model: A Survey
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
Event-based Motion Deblurring via Multi-Temporal Granularity Fusion
by: Lin, Xiaopeng, et al.
Published: (2024)
by: Lin, Xiaopeng, et al.
Published: (2024)
Towards Depth Foundation Model: Recent Trends in Vision-Based Depth Estimation
by: Xu, Zhen, et al.
Published: (2025)
by: Xu, Zhen, et al.
Published: (2025)
PerioDet: Large-Scale Panoramic Radiograph Benchmark for Clinical-Oriented Apical Periodontitis Detection
by: Fang, Xiaocheng, et al.
Published: (2025)
by: Fang, Xiaocheng, et al.
Published: (2025)
Exploring Temporal Dynamics in Event-based Eye Tracker
by: Ren, Hongwei, et al.
Published: (2025)
by: Ren, Hongwei, et al.
Published: (2025)
Reprogramming Vision Foundation Models for Spatio-Temporal Forecasting
by: Chen, Changlu, et al.
Published: (2025)
by: Chen, Changlu, et al.
Published: (2025)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
by: Wu, Rining, et al.
Published: (2024)
by: Wu, Rining, et al.
Published: (2024)
ClearSight: Human Vision-Inspired Solutions for Event-Based Motion Deblurring
by: Lin, Xiaopeng, et al.
Published: (2025)
by: Lin, Xiaopeng, et al.
Published: (2025)
Reconstruction as a Bridge for Event-Based Visual Question Answering
by: Lou, Hanyue, et al.
Published: (2025)
by: Lou, Hanyue, et al.
Published: (2025)
A Copula-Guided Temporal Dependency Method for Multitemporal Hyperspectral Images Unmixing
by: Li, Ruiying, et al.
Published: (2025)
by: Li, Ruiying, et al.
Published: (2025)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
by: Jian, Pu, et al.
Published: (2025)
by: Jian, Pu, et al.
Published: (2025)
Nonlinear Motion-Guided and Spatio-Temporal Aware Network for Unsupervised Event-Based Optical Flow
by: Liu, Zuntao, et al.
Published: (2025)
by: Liu, Zuntao, et al.
Published: (2025)
Spatio-Temporal Difference Guided Motion Deblurring with the Complementary Vision Sensor
by: Meng, Yapeng, et al.
Published: (2026)
by: Meng, Yapeng, et al.
Published: (2026)
Similar Items
-
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2024) -
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2023) -
Towards Scalable and Consistent 3D Editing
by: Xia, Ruihao, et al.
Published: (2025) -
Automotive Object Detection via Learning Sparse Events by Spiking Neurons
by: Zhang, Hu, et al.
Published: (2023) -
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
by: Wang, Liuyi, et al.
Published: (2024)