MedHorizon: Towards Long-context Medical Video Understanding in the Wild
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Bodong, Liu, Bowen, Yu, Yang, Ding, Xinpeng, Wu, Zhiheng, Wang, Shuning, Nie, Shuo, Liu, Naiming, Chen, Qifeng, Song, Yangqiu, Li, Xiaomeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Divide-then-Diagnose: Weaving Clinician-Inspired Contexts for Ultra-Long Capsule Endoscopy Videos
di: Liu, Bowen, et al.
Pubblicazione: (2026)
di: Liu, Bowen, et al.
Pubblicazione: (2026)
RadHiera: Semantic Hierarchical Reinforcement Learning for Medical Report Generation
di: Du, Bodong, et al.
Pubblicazione: (2025)
di: Du, Bodong, et al.
Pubblicazione: (2025)
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
di: Wu, Zhiheng, et al.
Pubblicazione: (2026)
di: Wu, Zhiheng, et al.
Pubblicazione: (2026)
Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration
di: Yang, Honglong, et al.
Pubblicazione: (2025)
di: Yang, Honglong, et al.
Pubblicazione: (2025)
Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning
di: Du, Bodong, et al.
Pubblicazione: (2026)
di: Du, Bodong, et al.
Pubblicazione: (2026)
Subgraph Aggregation for Out-of-Distribution Generalization on Graphs
di: Liu, Bowen, et al.
Pubblicazione: (2024)
di: Liu, Bowen, et al.
Pubblicazione: (2024)
WildLMa: Long Horizon Loco-Manipulation in the Wild
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2024)
di: Qiu, Ri-Zhao, et al.
Pubblicazione: (2024)
Tri-Plane Mamba: Efficiently Adapting Segment Anything Model for 3D Medical Images
di: Wang, Hualiang, et al.
Pubblicazione: (2024)
di: Wang, Hualiang, et al.
Pubblicazione: (2024)
QuarkMedSearch: A Long-Horizon Deep Search Agent for Exploring Medical Intelligence
di: Lin, Zhichao, et al.
Pubblicazione: (2026)
di: Lin, Zhichao, et al.
Pubblicazione: (2026)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
Spatially Grounded Long-Horizon Task Planning in the Wild
di: Jung, Sehun, et al.
Pubblicazione: (2026)
di: Jung, Sehun, et al.
Pubblicazione: (2026)
PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning
di: Ding, Xinpeng, et al.
Pubblicazione: (2025)
di: Ding, Xinpeng, et al.
Pubblicazione: (2025)
WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception
di: Liu, Zhiheng, et al.
Pubblicazione: (2025)
di: Liu, Zhiheng, et al.
Pubblicazione: (2025)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
di: Yang, Lin, et al.
Pubblicazione: (2026)
di: Yang, Lin, et al.
Pubblicazione: (2026)
LongVideoAgent: Multi-Agent Reasoning with Long Videos
di: Liu, Runtao, et al.
Pubblicazione: (2025)
di: Liu, Runtao, et al.
Pubblicazione: (2025)
1st Place Winner of the 2024 Pixel-level Video Understanding in the Wild (CVPR'24 PVUW) Challenge in Video Panoptic Segmentation and Best Long Video Consistency of Video Semantic Segmentation
di: Liu, Qingfeng, et al.
Pubblicazione: (2024)
di: Liu, Qingfeng, et al.
Pubblicazione: (2024)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
di: Ding, Shuangrui, et al.
Pubblicazione: (2026)
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models
di: Ding, Xinpeng, et al.
Pubblicazione: (2024)
di: Ding, Xinpeng, et al.
Pubblicazione: (2024)
MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding
di: Su, Yuhao, et al.
Pubblicazione: (2025)
di: Su, Yuhao, et al.
Pubblicazione: (2025)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
Towards Event-oriented Long Video Understanding
di: Du, Yifan, et al.
Pubblicazione: (2024)
di: Du, Yifan, et al.
Pubblicazione: (2024)
Towards Subgraph Isomorphism Counting with Graph Kernels
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
MedCoT: Medical Chain of Thought via Hierarchical Expert
di: Liu, Jiaxiang, et al.
Pubblicazione: (2024)
di: Liu, Jiaxiang, et al.
Pubblicazione: (2024)
Beyond Tools: Generative AI as Epistemic Infrastructure in Education
di: Chen, Bodong
Pubblicazione: (2025)
di: Chen, Bodong
Pubblicazione: (2025)
Deep Bayesian Reinforcement Learning for Spacecraft Proximity Maneuvers and Docking
di: Du, Desong, et al.
Pubblicazione: (2023)
di: Du, Desong, et al.
Pubblicazione: (2023)
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning
di: Yan, Sikuan, et al.
Pubblicazione: (2026)
di: Yan, Sikuan, et al.
Pubblicazione: (2026)
OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding
di: Jiang, Songtao, et al.
Pubblicazione: (2025)
di: Jiang, Songtao, et al.
Pubblicazione: (2025)
The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas
di: Xu, Baixuan, et al.
Pubblicazione: (2025)
di: Xu, Baixuan, et al.
Pubblicazione: (2025)
Channel Modeling and Rate Analysis of Optical Inter-Satellite Link (OISL)
di: Shang, Bodong, et al.
Pubblicazione: (2025)
di: Shang, Bodong, et al.
Pubblicazione: (2025)
InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
di: Liu, Zeyu, et al.
Pubblicazione: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
di: Xu, Huihui, et al.
Pubblicazione: (2025)
di: Xu, Huihui, et al.
Pubblicazione: (2025)
Towards Long-Horizon Vision-Language Navigation: Platform, Benchmark and Method
di: Song, Xinshuai, et al.
Pubblicazione: (2024)
di: Song, Xinshuai, et al.
Pubblicazione: (2024)
Towards More Unified In-context Visual Understanding
di: Sheng, Dianmo, et al.
Pubblicazione: (2023)
di: Sheng, Dianmo, et al.
Pubblicazione: (2023)
MedSapiens: Taking a Pose to Rethink Medical Imaging Landmark Detection
di: Elbatel, Marawan, et al.
Pubblicazione: (2025)
di: Elbatel, Marawan, et al.
Pubblicazione: (2025)
VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
di: Tian, Zeyue, et al.
Pubblicazione: (2024)
MedVSR: Medical Video Super-Resolution with Cross State-Space Propagation
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding
di: Liu, Shenxi, et al.
Pubblicazione: (2025)
di: Liu, Shenxi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Divide-then-Diagnose: Weaving Clinician-Inspired Contexts for Ultra-Long Capsule Endoscopy Videos
di: Liu, Bowen, et al.
Pubblicazione: (2026) -
RadHiera: Semantic Hierarchical Reinforcement Learning for Medical Report Generation
di: Du, Bodong, et al.
Pubblicazione: (2025) -
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection
di: Wu, Zhiheng, et al.
Pubblicazione: (2026) -
Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration
di: Yang, Honglong, et al.
Pubblicazione: (2025) -
Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning
di: Du, Bodong, et al.
Pubblicazione: (2026)