Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Rining, Zhou, Feixiang, Yin, Ziwei, Liu, Jian K. |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
von: Wang, Jingyi, et al.
Veröffentlicht: (2024)
von: Wang, Jingyi, et al.
Veröffentlicht: (2024)
ECMNet:Lightweight Semantic Segmentation with Efficient CNN-Mamba Network
von: Du, Feixiang, et al.
Veröffentlicht: (2025)
von: Du, Feixiang, et al.
Veröffentlicht: (2025)
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
von: Alawode, Basit, et al.
Veröffentlicht: (2025)
von: Alawode, Basit, et al.
Veröffentlicht: (2025)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
von: Wu, Junfei, et al.
Veröffentlicht: (2025)
BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model
von: Han, Yuci, et al.
Veröffentlicht: (2026)
von: Han, Yuci, et al.
Veröffentlicht: (2026)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
von: Zheng, Anlin, et al.
Veröffentlicht: (2025)
von: Zheng, Anlin, et al.
Veröffentlicht: (2025)
Knowledge-Aware Neuron Interpretation for Scene Classification
von: Guan, Yong, et al.
Veröffentlicht: (2024)
von: Guan, Yong, et al.
Veröffentlicht: (2024)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
von: Yin, Jianghao, et al.
Veröffentlicht: (2026)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
von: Wang, Huanyu, et al.
Veröffentlicht: (2025)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
von: Li, Shaotian, et al.
Veröffentlicht: (2026)
von: Li, Shaotian, et al.
Veröffentlicht: (2026)
Two-Stream Interactive Joint Learning of Scene Parsing and Geometric Vision Tasks
von: Tang, Guanfeng, et al.
Veröffentlicht: (2026)
von: Tang, Guanfeng, et al.
Veröffentlicht: (2026)
VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation
von: Sarowar, Md Selim, et al.
Veröffentlicht: (2025)
von: Sarowar, Md Selim, et al.
Veröffentlicht: (2025)
Towards Neural Foundation Models for Vision: Aligning EEG, MEG, and fMRI Representations for Decoding, Encoding, and Modality Conversion
von: Ferrante, Matteo, et al.
Veröffentlicht: (2024)
von: Ferrante, Matteo, et al.
Veröffentlicht: (2024)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024)
4D Panoptic Scene Graph Generation
von: Yang, Jingkang, et al.
Veröffentlicht: (2024)
von: Yang, Jingkang, et al.
Veröffentlicht: (2024)
Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
von: Liu, Hanqing, et al.
Veröffentlicht: (2026)
von: Liu, Hanqing, et al.
Veröffentlicht: (2026)
SoccerMaster: A Vision Foundation Model for Soccer Understanding
von: Yang, Haolin, et al.
Veröffentlicht: (2025)
von: Yang, Haolin, et al.
Veröffentlicht: (2025)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
von: Heinrich, Greg, et al.
Veröffentlicht: (2024)
von: Heinrich, Greg, et al.
Veröffentlicht: (2024)
Reprogramming Vision Foundation Models for Spatio-Temporal Forecasting
von: Chen, Changlu, et al.
Veröffentlicht: (2025)
von: Chen, Changlu, et al.
Veröffentlicht: (2025)
MRN: Harnessing 2D Vision Foundation Models for Diagnosing Parkinson's Disease with Limited 3D MR Data
von: Shaodong, Ding, et al.
Veröffentlicht: (2025)
von: Shaodong, Ding, et al.
Veröffentlicht: (2025)
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution
von: Liu, Cencen, et al.
Veröffentlicht: (2026)
von: Liu, Cencen, et al.
Veröffentlicht: (2026)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
von: Shi, Xinrui, et al.
Veröffentlicht: (2026)
von: Shi, Xinrui, et al.
Veröffentlicht: (2026)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
von: He, Xingxin, et al.
Veröffentlicht: (2025)
von: He, Xingxin, et al.
Veröffentlicht: (2025)
FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
von: Zuo, Xingxing, et al.
Veröffentlicht: (2024)
von: Zuo, Xingxing, et al.
Veröffentlicht: (2024)
Selective Visual Prompting in Vision Mamba
von: Yao, Yifeng, et al.
Veröffentlicht: (2024)
von: Yao, Yifeng, et al.
Veröffentlicht: (2024)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
von: Cao, Yue, et al.
Veröffentlicht: (2024)
von: Cao, Yue, et al.
Veröffentlicht: (2024)
EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
von: Zhang, Yi, et al.
Veröffentlicht: (2025)
The Scene Language: Representing Scenes with Programs, Words, and Embeddings
von: Zhang, Yunzhi, et al.
Veröffentlicht: (2024)
von: Zhang, Yunzhi, et al.
Veröffentlicht: (2024)
General Scene Adaptation for Vision-and-Language Navigation
von: Hong, Haodong, et al.
Veröffentlicht: (2025)
von: Hong, Haodong, et al.
Veröffentlicht: (2025)
The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models
von: Ong, Kenneth J. K.
Veröffentlicht: (2026)
von: Ong, Kenneth J. K.
Veröffentlicht: (2026)
Skill-Conditioned Visual Geolocation for Vision-Language Models
von: Yang, Chenjie, et al.
Veröffentlicht: (2026)
von: Yang, Chenjie, et al.
Veröffentlicht: (2026)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
von: Xiao, Zhendong, et al.
Veröffentlicht: (2025)
von: Xiao, Zhendong, et al.
Veröffentlicht: (2025)
Pair then Relation: Pair-Net for Panoptic Scene Graph Generation
von: Wang, Jinghao, et al.
Veröffentlicht: (2023)
von: Wang, Jinghao, et al.
Veröffentlicht: (2023)
Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images
von: Wu, Shengguang, et al.
Veröffentlicht: (2025)
von: Wu, Shengguang, et al.
Veröffentlicht: (2025)
Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding
von: Elhenawy, Mohammed, et al.
Veröffentlicht: (2025)
von: Elhenawy, Mohammed, et al.
Veröffentlicht: (2025)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
von: Zhou, Guanyu, et al.
Veröffentlicht: (2026)
von: Zhou, Guanyu, et al.
Veröffentlicht: (2026)
DynaMind: Reconstructing Dynamic Visual Scenes from EEG by Aligning Temporal Dynamics and Multimodal Semantics to Guided Diffusion
von: Liu, Junxiang, et al.
Veröffentlicht: (2025)
von: Liu, Junxiang, et al.
Veröffentlicht: (2025)
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
von: Fan, Jiawei, et al.
Veröffentlicht: (2026)
von: Fan, Jiawei, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
von: Wang, Jingyi, et al.
Veröffentlicht: (2024) -
ECMNet:Lightweight Semantic Segmentation with Efficient CNN-Mamba Network
von: Du, Feixiang, et al.
Veröffentlicht: (2025) -
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
von: Alawode, Basit, et al.
Veröffentlicht: (2025) -
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
von: Wu, Junfei, et al.
Veröffentlicht: (2025) -
BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model
von: Han, Yuci, et al.
Veröffentlicht: (2026)