Building Vision Models upon Heat Conduction
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zhaozhi, Liu, Yue, Tian, Yunjie, Liu, Yunfan, Wang, Yaowei, Ye, Qixiang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Spatial Transform Decoupling for Oriented Object Detection
by: Yu, Hongtian, et al.
Published: (2023)
by: Yu, Hongtian, et al.
Published: (2023)
VMamba: Visual State Space Model
by: Liu, Yue, et al.
Published: (2024)
by: Liu, Yue, et al.
Published: (2024)
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
by: Wang, Zhaozhi, et al.
Published: (2025)
by: Wang, Zhaozhi, et al.
Published: (2025)
RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model
by: Hu, Huiyang, et al.
Published: (2024)
by: Hu, Huiyang, et al.
Published: (2024)
Mixture of Physical Priors Adapter for Parameter-Efficient Fine-Tuning
by: Wang, Zhaozhi, et al.
Published: (2024)
by: Wang, Zhaozhi, et al.
Published: (2024)
Fast-iTPN: Integrally Pre-Trained Transformer Pyramid Network with Token Migration
by: Tian, Yunjie, et al.
Published: (2022)
by: Tian, Yunjie, et al.
Published: (2022)
YOLOv12: Attention-Centric Real-Time Object Detectors
by: Tian, Yunjie, et al.
Published: (2025)
by: Tian, Yunjie, et al.
Published: (2025)
CC-Diff: Enhancing Contextual Coherence in Remote Sensing Image Synthesis
by: Zhang, Mu, et al.
Published: (2024)
by: Zhang, Mu, et al.
Published: (2024)
Expandable Residual Approximation for Knowledge Distillation
by: Yan, Zhaoyi, et al.
Published: (2025)
by: Yan, Zhaoyi, et al.
Published: (2025)
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
by: Ma, Tianren, et al.
Published: (2024)
by: Ma, Tianren, et al.
Published: (2024)
Virtual Classification: Modulating Domain-Specific Knowledge for Multidomain Crowd Counting
by: Guo, Mingyue, et al.
Published: (2024)
by: Guo, Mingyue, et al.
Published: (2024)
Regressor-Segmenter Mutual Prompt Learning for Crowd Counting
by: Guo, Mingyue, et al.
Published: (2023)
by: Guo, Mingyue, et al.
Published: (2023)
Personalized Large Vision-Language Models
by: Pham, Chau, et al.
Published: (2024)
by: Pham, Chau, et al.
Published: (2024)
Human Activity Recognition using RGB-Event based Sensors: A Multi-modal Heat Conduction Model and A Benchmark Dataset
by: Wang, Shiao, et al.
Published: (2025)
by: Wang, Shiao, et al.
Published: (2025)
ChatterBox: Multi-round Multimodal Referring and Grounding
by: Tian, Yunjie, et al.
Published: (2024)
by: Tian, Yunjie, et al.
Published: (2024)
Delving Deep into Semantic Relation Distillation
by: Yan, Zhaoyi, et al.
Published: (2025)
by: Yan, Zhaoyi, et al.
Published: (2025)
Adaptive Keyframe Sampling for Long Video Understanding
by: Tang, Xi, et al.
Published: (2025)
by: Tang, Xi, et al.
Published: (2025)
Vision Calorimeter for Anti-neutron Reconstruction: A Baseline
by: Yu, Hongtian, et al.
Published: (2024)
by: Yu, Hongtian, et al.
Published: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
by: Tian, Yuxin, et al.
Published: (2024)
by: Tian, Yuxin, et al.
Published: (2024)
Self-supervised Feature-Gate Coupling for Dynamic Network Pruning
by: Shi, Mengnan, et al.
Published: (2021)
by: Shi, Mengnan, et al.
Published: (2021)
HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
by: Liu, Jizhihui, et al.
Published: (2025)
by: Liu, Jizhihui, et al.
Published: (2025)
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
by: Zhao, Yuzhong, et al.
Published: (2024)
by: Zhao, Yuzhong, et al.
Published: (2024)
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
by: Li, Qiming, et al.
Published: (2025)
by: Li, Qiming, et al.
Published: (2025)
What Matters in Building Vision-Language-Action Models for Generalist Robots
by: Li, Xinghang, et al.
Published: (2024)
by: Li, Xinghang, et al.
Published: (2024)
Dynamic Multimodal Prototype Learning in Vision-Language Models
by: Zhu, Xingyu, et al.
Published: (2025)
by: Zhu, Xingyu, et al.
Published: (2025)
Revisit Event Generation Model: Self-Supervised Learning of Event-to-Video Reconstruction with Implicit Neural Representations
by: Wang, Zipeng, et al.
Published: (2024)
by: Wang, Zipeng, et al.
Published: (2024)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
by: Zhou, Zikun, et al.
Published: (2024)
by: Zhou, Zikun, et al.
Published: (2024)
Debiased Prompt Tuning in Vision-Language Model without Annotations
by: Jiang, Chaoquan, et al.
Published: (2025)
by: Jiang, Chaoquan, et al.
Published: (2025)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
by: Qiu, Jihao, et al.
Published: (2026)
by: Qiu, Jihao, et al.
Published: (2026)
SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition
by: Liu, Hongda, et al.
Published: (2025)
by: Liu, Hongda, et al.
Published: (2025)
ControlCap: Controllable Region-level Captioning
by: Zhao, Yuzhong, et al.
Published: (2024)
by: Zhao, Yuzhong, et al.
Published: (2024)
Artemis: Towards Referential Understanding in Complex Videos
by: Qiu, Jihao, et al.
Published: (2024)
by: Qiu, Jihao, et al.
Published: (2024)
Improving Deep Representation Learning via Auxiliary Learnable Target Coding
by: Liu, Kangjun, et al.
Published: (2023)
by: Liu, Kangjun, et al.
Published: (2023)
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
by: Wu, Mingrui, et al.
Published: (2025)
by: Wu, Mingrui, et al.
Published: (2025)
CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
by: Li, Qiming, et al.
Published: (2026)
by: Li, Qiming, et al.
Published: (2026)
RadioFormer3D: Weakly Supervised 3D Radio Map Estimation in Low-Altitude Airspace via Generative Modeling
by: Fang, Zheng, et al.
Published: (2026)
by: Fang, Zheng, et al.
Published: (2026)
CLIP-based Synergistic Knowledge Transfer for Text-based Person Retrieval
by: Liu, Yating, et al.
Published: (2023)
by: Liu, Yating, et al.
Published: (2023)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
by: Ye, Weixin, et al.
Published: (2026)
by: Ye, Weixin, et al.
Published: (2026)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
by: Yang, Fan, et al.
Published: (2025)
by: Yang, Fan, et al.
Published: (2025)
Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks
by: Zheng, Xu, et al.
Published: (2023)
by: Zheng, Xu, et al.
Published: (2023)
Similar Items
-
Spatial Transform Decoupling for Oriented Object Detection
by: Yu, Hongtian, et al.
Published: (2023) -
VMamba: Visual State Space Model
by: Liu, Yue, et al.
Published: (2024) -
VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning
by: Wang, Zhaozhi, et al.
Published: (2025) -
RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model
by: Hu, Huiyang, et al.
Published: (2024) -
Mixture of Physical Priors Adapter for Parameter-Efficient Fine-Tuning
by: Wang, Zhaozhi, et al.
Published: (2024)