Leum-VL Technical Report
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Yuxuan, Huang, Chaiming, Wu, Yifan, Wang, Hongjun, Shen, Chenkui, Zhang, Jifan, Li, Long |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
par: Chen, Yuangong, et autres
Publié: (2026)
par: Chen, Yuangong, et autres
Publié: (2026)
FlexDoc: Parameterized Sampling for Diverse Multilingual Synthetic Documents for Training Document Understanding Models
par: Dua, Karan, et autres
Publié: (2025)
par: Dua, Karan, et autres
Publié: (2025)
WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents
par: Liu, Bingnan, et autres
Publié: (2026)
par: Liu, Bingnan, et autres
Publié: (2026)
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026)
par: Oliveira, Daniel, et autres
Publié: (2026)
RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
Geo2Sound: A Scalable Geo-Aligned Framework for Soundscape Generation from Satellite Imagery
par: Wu, Kunlin, et autres
Publié: (2026)
par: Wu, Kunlin, et autres
Publié: (2026)
DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction
par: Hou, Zhiyi, et autres
Publié: (2025)
par: Hou, Zhiyi, et autres
Publié: (2025)
PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
GLoT: A Novel Gated-Logarithmic Transformer for Efficient Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
par: Zhong, Zesen, et autres
Publié: (2025)
par: Zhong, Zesen, et autres
Publié: (2025)
VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions
par: Pu, Qingwen, et autres
Publié: (2026)
par: Pu, Qingwen, et autres
Publié: (2026)
Transfer-learning for video classification: Video Swin Transformer on multiple domains
par: Oliveira, Daniel A. P., et autres
Publié: (2022)
par: Oliveira, Daniel A. P., et autres
Publié: (2022)
ADAT: Time-Series-Aware Adaptive Transformer Architecture for Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
Mechanisms of Prompt-Induced Hallucination in Vision-Language Models
par: Rudman, William, et autres
Publié: (2026)
par: Rudman, William, et autres
Publié: (2026)
A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video
par: Lucas, Andrea Filiberto, et autres
Publié: (2026)
par: Lucas, Andrea Filiberto, et autres
Publié: (2026)
A Roadmap for Multilingual, Multimodal Domain Independent Deception Detection
par: Boumber, Dainis, et autres
Publié: (2024)
par: Boumber, Dainis, et autres
Publié: (2024)
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
par: Durrani, Hamza Ahmed, et autres
Publié: (2026)
par: Durrani, Hamza Ahmed, et autres
Publié: (2026)
GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models
par: Hacheme, Gilles Quentin, et autres
Publié: (2025)
par: Hacheme, Gilles Quentin, et autres
Publié: (2025)
Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning
par: Ji, Binbin, et autres
Publié: (2025)
par: Ji, Binbin, et autres
Publié: (2025)
Semi supervised GAN for smart microscopy, fast and data efficient cell cycle classification
par: Manick, Rajeev, et autres
Publié: (2026)
par: Manick, Rajeev, et autres
Publié: (2026)
Beyond RNNs: Benchmarking Attention-Based Image Captioning Models
par: Yanambakkam, Hemanth Teja, et autres
Publié: (2025)
par: Yanambakkam, Hemanth Teja, et autres
Publié: (2025)
VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors
par: Lyu, Wenbo, et autres
Publié: (2025)
par: Lyu, Wenbo, et autres
Publié: (2025)
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
par: Korolkov, Vasilii
Publié: (2025)
par: Korolkov, Vasilii
Publié: (2025)
From eye to AI: studying rodent social behavior in the era of machine Learning
par: Chindemi, Giuseppe, et autres
Publié: (2025)
par: Chindemi, Giuseppe, et autres
Publié: (2025)
OmniAcc: Personalized Accessibility Assistant Using Generative AI
par: Karki, Siddhant, et autres
Publié: (2025)
par: Karki, Siddhant, et autres
Publié: (2025)
Sign language recognition based on deep learning and low-cost handcrafted descriptors
par: Carneiro, Alvaro Leandro Cavalcante, et autres
Publié: (2024)
par: Carneiro, Alvaro Leandro Cavalcante, et autres
Publié: (2024)
Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens
par: Shen, Meng, et autres
Publié: (2026)
par: Shen, Meng, et autres
Publié: (2026)
SSD-GS: Scattering and Shadow Decomposition for Relightable 3D Gaussian Splatting
par: Zheng, Iris, et autres
Publié: (2026)
par: Zheng, Iris, et autres
Publié: (2026)
MSGS: Multispectral 3D Gaussian Splatting
par: Zheng, Iris, et autres
Publié: (2026)
par: Zheng, Iris, et autres
Publié: (2026)
The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering
par: Pandey, Anupam, et autres
Publié: (2025)
par: Pandey, Anupam, et autres
Publié: (2025)
HATL: Hierarchical Adaptive-Transfer Learning Framework for Sign Language Machine Translation
par: Shahin, Nada, et autres
Publié: (2026)
par: Shahin, Nada, et autres
Publié: (2026)
DRIFT open dataset: A drone-derived intelligence for traffic analysis in urban environment
par: Lee, Hyejin, et autres
Publié: (2025)
par: Lee, Hyejin, et autres
Publié: (2025)
YETI (YET to Intervene) Proactive Interventions by Multimodal AI Agents in Augmented Reality Tasks
par: Bandyopadhyay, Saptarashmi, et autres
Publié: (2025)
par: Bandyopadhyay, Saptarashmi, et autres
Publié: (2025)
A Simple Baseline for Streaming Video Understanding
par: Shen, Yujiao, et autres
Publié: (2026)
par: Shen, Yujiao, et autres
Publié: (2026)
Visible Iris Area as a Quality Metric for Reliable Iris Recognition Under Pupil Dilation and Eyelid Occlusion
par: Pessaud, Jack, et autres
Publié: (2025)
par: Pessaud, Jack, et autres
Publié: (2025)
Vi-SAFE: A Spatial-Temporal Framework for Efficient Violence Detection in Public Surveillance
par: Chang, Ligang, et autres
Publié: (2025)
par: Chang, Ligang, et autres
Publié: (2025)
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
par: Jin, Haopeng, et autres
Publié: (2026)
par: Jin, Haopeng, et autres
Publié: (2026)
3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model
par: Ko, Hyun-kyu, et autres
Publié: (2026)
par: Ko, Hyun-kyu, et autres
Publié: (2026)
PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model
par: Zhang, Sinin, et autres
Publié: (2026)
par: Zhang, Sinin, et autres
Publié: (2026)
Documents similaires
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025) -
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
par: Chen, Yuangong, et autres
Publié: (2026) -
FlexDoc: Parameterized Sampling for Diverse Multilingual Synthetic Documents for Training Document Understanding Models
par: Dua, Karan, et autres
Publié: (2025) -
WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents
par: Liu, Bingnan, et autres
Publié: (2026) -
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026)