Enregistré dans:
| Auteurs principaux: | Li, Zhiqi, Chen, Guo, Liu, Shilong, Wang, Shihao, VS, Vibashan, Ji, Yishen, Lan, Shiyi, Zhang, Hao, Zhao, Yilin, Radhakrishnan, Subhashree, Chang, Nadine, Sapra, Karan, Deshmukh, Amala Sanjay, Rintamaki, Tuomas, Le, Matthieu, Karmanov, Ilia, Voegtle, Lukas, Fischer, Philipp, Huang, De-An, Roman, Timo, Lu, Tong, Alvarez, Jose M., Catanzaro, Bryan, Kautz, Jan, Tao, Andrew, Liu, Guilin, Yu, Zhiding |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.14818 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
par: Shi, Min, et autres
Publié: (2024)
par: Shi, Min, et autres
Publié: (2024)
Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents
par: Karmanov, Ilia, et autres
Publié: (2025)
par: Karmanov, Ilia, et autres
Publié: (2025)
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
par: Chen, Guo, et autres
Publié: (2025)
par: Chen, Guo, et autres
Publié: (2025)
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026)
par: Jiang, Jindong, et autres
Publié: (2026)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
par: Huang, De-An, et autres
Publié: (2025)
par: Huang, De-An, et autres
Publié: (2025)
LITA: Language Instructed Temporal-Localization Assistant
par: Huang, De-An, et autres
Publié: (2024)
par: Huang, De-An, et autres
Publié: (2024)
Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
par: Li, Zhenxin, et autres
Publié: (2024)
par: Li, Zhenxin, et autres
Publié: (2024)
FaceXBench: Evaluating Multimodal LLMs on Face Understanding
par: Narayan, Kartik, et autres
Publié: (2025)
par: Narayan, Kartik, et autres
Publié: (2025)
Certainty and Uncertainty Guided Active Domain Adaptation
par: Safaei, Bardia, et autres
Publié: (2025)
par: Safaei, Bardia, et autres
Publié: (2025)
SegFace: Face Segmentation of Long-Tail Classes
par: Narayan, Kartik, et autres
Publié: (2024)
par: Narayan, Kartik, et autres
Publié: (2024)
AIDE: Agentically Improve Visual Language Model with Domain Experts
par: Chiu, Ming-Chang, et autres
Publié: (2025)
par: Chiu, Ming-Chang, et autres
Publié: (2025)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
par: Wang, Shihao, et autres
Publié: (2026)
par: Wang, Shihao, et autres
Publié: (2026)
What is Point Supervision Worth in Video Instance Segmentation?
par: Huang, Shuaiyi, et autres
Publié: (2024)
par: Huang, Shuaiyi, et autres
Publié: (2024)
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving?
par: Li, Zhiqi, et autres
Publié: (2023)
par: Li, Zhiqi, et autres
Publié: (2023)
FaceXFormer: A Unified Transformer for Facial Analysis
par: Narayan, Kartik, et autres
Publié: (2024)
par: Narayan, Kartik, et autres
Publié: (2024)
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
par: Zhang, Shaokun, et autres
Publié: (2025)
par: Zhang, Shaokun, et autres
Publié: (2025)
OMCAT: Omni Context Aware Transformer
par: Goel, Arushi, et autres
Publié: (2024)
par: Goel, Arushi, et autres
Publié: (2024)
PhyCritic: Multimodal Critic Models for Physical AI
par: Xiong, Tianyi, et autres
Publié: (2026)
par: Xiong, Tianyi, et autres
Publié: (2026)
StreamChat: Chatting with Streaming Video
par: Liu, Jihao, et autres
Publié: (2024)
par: Liu, Jihao, et autres
Publié: (2024)
ImagineMap: Enhanced HD Map Construction with SD Maps
par: Ji, Yishen, et autres
Publié: (2024)
par: Ji, Yishen, et autres
Publié: (2024)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
par: Man, Yunze, et autres
Publié: (2025)
par: Man, Yunze, et autres
Publié: (2025)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
par: Ranasinghe, Yasiru, et autres
Publié: (2025)
par: Ranasinghe, Yasiru, et autres
Publié: (2025)
Mensch - Maske - Tier. Zu den Entstehungsbedingungen der Karikatur
par: Simone Voegtle
Publié: (2017)
par: Simone Voegtle
Publié: (2017)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
par: Wang, Shihao, et autres
Publié: (2024)
par: Wang, Shihao, et autres
Publié: (2024)
NVIDIA Nemotron Parse 1.1
par: Chumachenko, Kateryna, et autres
Publié: (2025)
par: Chumachenko, Kateryna, et autres
Publié: (2025)
PARC: A Quantitative Framework Uncovering the Symmetries within Vision Language Models
par: Schmalfuss, Jenny, et autres
Publié: (2025)
par: Schmalfuss, Jenny, et autres
Publié: (2025)
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
par: Chen, Guo, et autres
Publié: (2026)
par: Chen, Guo, et autres
Publié: (2026)
Hydra-NeXt: Robust Closed-Loop Driving with Open-Loop Training
par: Li, Zhenxin, et autres
Publié: (2025)
par: Li, Zhenxin, et autres
Publié: (2025)
NVLM: Open Frontier-Class Multimodal LLMs
par: Dai, Wenliang, et autres
Publié: (2024)
par: Dai, Wenliang, et autres
Publié: (2024)
PosSAM: Panoptic Open-vocabulary Segment Anything
par: VS, Vibashan, et autres
Publié: (2024)
par: VS, Vibashan, et autres
Publié: (2024)
LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
par: Man, Yunze, et autres
Publié: (2025)
par: Man, Yunze, et autres
Publié: (2025)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
par: Zhen, Haoyu, et autres
Publié: (2026)
par: Zhen, Haoyu, et autres
Publié: (2026)
StereoDETR: Stereo-based Transformer for 3D Object Detection
par: Mu, Shiyi, et autres
Publié: (2025)
par: Mu, Shiyi, et autres
Publié: (2025)
Old age, high risk medication, polypharmacy: a ‘trilogy’ of risks in older patients with atrial fibrillation
par: Yishen WANG
Publié: (2016)
par: Yishen WANG
Publié: (2016)
Image-to-Text for Medical Reports Using Adaptive Co-Attention and Triple-LSTM Module
par: Liu, Yishen
Publié: (2025)
par: Liu, Yishen
Publié: (2025)
Developing an Ontology for AI Act Fundamental Rights Impact Assessments
par: Rintamaki, Tytti, et autres
Publié: (2024)
par: Rintamaki, Tytti, et autres
Publié: (2024)
Towards An Automated AI Act FRIA Tool That Can Reuse GDPR's DPIA
par: Rintamaki, Tytti, et autres
Publié: (2024)
par: Rintamaki, Tytti, et autres
Publié: (2024)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
par: Shi, Min, et autres
Publié: (2025)
par: Shi, Min, et autres
Publié: (2025)
Documents similaires
-
Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
par: Shi, Min, et autres
Publié: (2024) -
Éclair -- Extracting Content and Layout with Integrated Reading Order for Documents
par: Karmanov, Ilia, et autres
Publié: (2025) -
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
par: Chen, Guo, et autres
Publié: (2025) -
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026) -
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
par: Huang, De-An, et autres
Publié: (2025)