Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yuan, Dou, Sihao, Hu, Kai, Deng, Shuhua, Cao, Chunhong, Xiao, Fen, Gao, Xieping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distilling Knowledge from Heterogeneous Architectures for Semantic Segmentation
di: Huang, Yanglin, et al.
Pubblicazione: (2025)
di: Huang, Yanglin, et al.
Pubblicazione: (2025)
What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation
di: Lin, Jianghang, et al.
Pubblicazione: (2025)
di: Lin, Jianghang, et al.
Pubblicazione: (2025)
Focus Entirety and Perceive Environment for Arbitrary-Shaped Text Detection
di: Han, Xu, et al.
Pubblicazione: (2024)
di: Han, Xu, et al.
Pubblicazione: (2024)
Hierarchical Banzhaf Interaction for General Video-Language Representation Learning
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
Self-Supervised Learning for Endoscopic Video Analysis
di: Hirsch, Roy, et al.
Pubblicazione: (2023)
di: Hirsch, Roy, et al.
Pubblicazione: (2023)
Explicit Relational Reasoning Network for Scene Text Detection
di: Su, Yuchen, et al.
Pubblicazione: (2024)
di: Su, Yuchen, et al.
Pubblicazione: (2024)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
Cognitive-Inspired Hierarchical Attention Fusion With Visual and Textual for Cross-Domain Sequential Recommendation
di: Wu, Wangyu, et al.
Pubblicazione: (2025)
di: Wu, Wangyu, et al.
Pubblicazione: (2025)
LocoMotion: Learning Motion-Focused Video-Language Representations
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
Learning to Rank Patches for Unbiased Image Redundancy Reduction
di: Luo, Yang, et al.
Pubblicazione: (2024)
di: Luo, Yang, et al.
Pubblicazione: (2024)
Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models
di: Huang, He, et al.
Pubblicazione: (2025)
di: Huang, He, et al.
Pubblicazione: (2025)
EndoMamba: An Efficient Foundation Model for Endoscopic Videos via Hierarchical Pre-training
di: Tian, Qingyao, et al.
Pubblicazione: (2025)
di: Tian, Qingyao, et al.
Pubblicazione: (2025)
Causal Perception Inspired Representation Learning for Trustworthy Image Quality Assessment
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Manipulating a Tetris-Inspired 3D Video Representation
di: Godbole, Mihir
Pubblicazione: (2024)
di: Godbole, Mihir
Pubblicazione: (2024)
Out of Length Text Recognition with Sub-String Matching
di: Du, Yongkun, et al.
Pubblicazione: (2024)
di: Du, Yongkun, et al.
Pubblicazione: (2024)
MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding
di: Cao, Shiwen, et al.
Pubblicazione: (2025)
di: Cao, Shiwen, et al.
Pubblicazione: (2025)
Video Compression with Hierarchical Temporal Neural Representation
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning
di: You, Weihang, et al.
Pubblicazione: (2026)
di: You, Weihang, et al.
Pubblicazione: (2026)
A Point-Neighborhood Learning Framework for Nasal Endoscope Image Segmentation
di: Jie, Pengyu, et al.
Pubblicazione: (2024)
di: Jie, Pengyu, et al.
Pubblicazione: (2024)
Joint-Motion Mutual Learning for Pose Estimation in Videos
di: Wu, Sifan, et al.
Pubblicazione: (2024)
di: Wu, Sifan, et al.
Pubblicazione: (2024)
Enhanced Scale-aware Depth Estimation for Monocular Endoscopic Scenes with Geometric Modeling
di: Wei, Ruofeng, et al.
Pubblicazione: (2024)
di: Wei, Ruofeng, et al.
Pubblicazione: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
Learning Brain Representation with Hierarchical Visual Embeddings
di: Zheng, Jiawen, et al.
Pubblicazione: (2026)
di: Zheng, Jiawen, et al.
Pubblicazione: (2026)
MetaCOG: A Hierarchical Probabilistic Model for Learning Meta-Cognitive Visual Representations
di: Berke, Marlene D., et al.
Pubblicazione: (2021)
di: Berke, Marlene D., et al.
Pubblicazione: (2021)
GaussianVideo: Efficient Video Representation via Hierarchical Gaussian Splatting
di: Bond, Andrew, et al.
Pubblicazione: (2025)
di: Bond, Andrew, et al.
Pubblicazione: (2025)
State-Change Learning for Prediction of Future Events in Endoscopic Videos
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
di: Sharma, Saurav, et al.
Pubblicazione: (2025)
Learning Spatial-Preserving Hierarchical Representations for Digital Pathology
di: Wu, Weiyi, et al.
Pubblicazione: (2024)
di: Wu, Weiyi, et al.
Pubblicazione: (2024)
EndoGen: Conditional Autoregressive Endoscopic Video Generation
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction
di: Wei, Yujie, et al.
Pubblicazione: (2026)
di: Wei, Yujie, et al.
Pubblicazione: (2026)
FocusDiffuser: Perceiving Local Disparities for Camouflaged Object Detection
di: Zhao, Jianwei, et al.
Pubblicazione: (2024)
di: Zhao, Jianwei, et al.
Pubblicazione: (2024)
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
di: Zhao, Fufangchen, et al.
Pubblicazione: (2025)
Endo3R: Unified Online Reconstruction from Dynamic Monocular Endoscopic Video
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
Multi-entity Video Transformers for Fine-Grained Video Representation Learning
di: Walmer, Matthew, et al.
Pubblicazione: (2023)
di: Walmer, Matthew, et al.
Pubblicazione: (2023)
HiNeRV: Video Compression with Hierarchical Encoding-based Neural Representation
di: Kwan, Ho Man, et al.
Pubblicazione: (2023)
di: Kwan, Ho Man, et al.
Pubblicazione: (2023)
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
di: Yan, Haiyang, et al.
Pubblicazione: (2026)
di: Yan, Haiyang, et al.
Pubblicazione: (2026)
RARE disease detection from Capsule Endoscopic Videos based on Vision Transformers
di: Gao, X., et al.
Pubblicazione: (2026)
di: Gao, X., et al.
Pubblicazione: (2026)
Multi-Object Tracking by Hierarchical Visual Representations
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
di: Cao, Jinkun, et al.
Pubblicazione: (2024)
DiffCL: A Diffusion-Based Contrastive Learning Framework with Semantic Alignment for Multimodal Recommendations
di: Song, Qiya, et al.
Pubblicazione: (2025)
di: Song, Qiya, et al.
Pubblicazione: (2025)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Distilling Knowledge from Heterogeneous Architectures for Semantic Segmentation
di: Huang, Yanglin, et al.
Pubblicazione: (2025) -
What You Perceive Is What You Conceive: A Cognition-Inspired Framework for Open Vocabulary Image Segmentation
di: Lin, Jianghang, et al.
Pubblicazione: (2025) -
Focus Entirety and Perceive Environment for Arbitrary-Shaped Text Detection
di: Han, Xu, et al.
Pubblicazione: (2024) -
Hierarchical Banzhaf Interaction for General Video-Language Representation Learning
di: Jin, Peng, et al.
Pubblicazione: (2024) -
Self-Supervised Learning for Endoscopic Video Analysis
di: Hirsch, Roy, et al.
Pubblicazione: (2023)