Multi-Agent Visual-Language Reasoning for Comprehensive Highway Scene Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yunxiang, Xu, Ningning, Yang, Jidong J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference
por: Yang, Yunxiang, et al.
Publicado: (2025)
por: Yang, Yunxiang, et al.
Publicado: (2025)
Leveraging Scene Geometry and Depth Information for Robust Image Deraining
por: Xu, Ningning, et al.
Publicado: (2024)
por: Xu, Ningning, et al.
Publicado: (2024)
Enhancing autonomous vehicle safety in rain: a data-centric approach for clear vision
por: Seferian, Mark A., et al.
Publicado: (2024)
por: Seferian, Mark A., et al.
Publicado: (2024)
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
por: Shi, Baorong, et al.
Publicado: (2026)
por: Shi, Baorong, et al.
Publicado: (2026)
Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding
por: Guo, Weiyu, et al.
Publicado: (2025)
por: Guo, Weiyu, et al.
Publicado: (2025)
Comprehensive Evaluation of Multimodal AI Models in Medical Imaging Diagnosis: From Data Augmentation to Preference-Based Comparison
por: Ruan, Cailian, et al.
Publicado: (2024)
por: Ruan, Cailian, et al.
Publicado: (2024)
Replace-then-Perturb: Targeted Adversarial Attacks With Visual Reasoning for Vision-Language Models
por: Jang, Jonggyu, et al.
Publicado: (2024)
por: Jang, Jonggyu, et al.
Publicado: (2024)
High Efficiency Image Compression for Large Visual-Language Models
por: Li, Binzhe, et al.
Publicado: (2024)
por: Li, Binzhe, et al.
Publicado: (2024)
A Transformer-Based Multi-Stream Approach for Isolated Iranian Sign Language Recognition
por: Ghadami, Ali, et al.
Publicado: (2024)
por: Ghadami, Ali, et al.
Publicado: (2024)
VisionUnite: A Vision-Language Foundation Model for Ophthalmology Enhanced with Clinical Knowledge
por: Li, Zihan, et al.
Publicado: (2024)
por: Li, Zihan, et al.
Publicado: (2024)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
por: Gavrikov, Paul, et al.
Publicado: (2025)
por: Gavrikov, Paul, et al.
Publicado: (2025)
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
por: Zhu, Wenhui, et al.
Publicado: (2025)
por: Zhu, Wenhui, et al.
Publicado: (2025)
MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
por: Chen, Feilong, et al.
Publicado: (2025)
por: Chen, Feilong, et al.
Publicado: (2025)
Scale-aware Adaptive Supervised Network with Limited Medical Annotations
por: Li, Zihan, et al.
Publicado: (2026)
por: Li, Zihan, et al.
Publicado: (2026)
Light-weight Retinal Layer Segmentation with Global Reasoning
por: He, Xiang, et al.
Publicado: (2024)
por: He, Xiang, et al.
Publicado: (2024)
Towards Cardiac MRI Foundation Models: Comprehensive Visual-Tabular Representations for Whole-Heart Assessment and Beyond
por: Zhang, Yundi, et al.
Publicado: (2025)
por: Zhang, Yundi, et al.
Publicado: (2025)
A Versatile Pathology Co-pilot via Reasoning Enhanced Multimodal Large Language Model
por: Xu, Zhe, et al.
Publicado: (2025)
por: Xu, Zhe, et al.
Publicado: (2025)
Learning Multi-scale Spatial-frequency Features for Image Denoising
por: Zhao, Xu, et al.
Publicado: (2025)
por: Zhao, Xu, et al.
Publicado: (2025)
Mammo-CLIP: Leveraging Contrastive Language-Image Pre-training (CLIP) for Enhanced Breast Cancer Diagnosis with Multi-view Mammography
por: Chen, Xuxin, et al.
Publicado: (2024)
por: Chen, Xuxin, et al.
Publicado: (2024)
Global Rice Multi-Class Segmentation Dataset (RiceSEG): A Comprehensive and Diverse High-Resolution RGB-Annotated Images for the Development and Benchmarking of Rice Segmentation Algorithms
por: Zhou, Junchi, et al.
Publicado: (2025)
por: Zhou, Junchi, et al.
Publicado: (2025)
ACE-SLAM: Scene Coordinate Regression for Neural Implicit Real-Time SLAM
por: Alzugaray, Ignacio, et al.
Publicado: (2025)
por: Alzugaray, Ignacio, et al.
Publicado: (2025)
Prompt Mechanisms in Medical Imaging: A Comprehensive Survey
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
Lost in Translation? Translation Errors and Challenges for Fair Assessment of Text-to-Image Models on Multilingual Concepts
por: Saxon, Michael, et al.
Publicado: (2024)
por: Saxon, Michael, et al.
Publicado: (2024)
Utilizing Multi-Agent Reinforcement Learning with Encoder-Decoder Architecture Agents to Identify Optimal Resection Location in Glioblastoma Multiforme Patients
por: Arun, Krishna, et al.
Publicado: (2025)
por: Arun, Krishna, et al.
Publicado: (2025)
Improving Representation of High-frequency Components for Medical Visual Foundation Models
por: Chu, Yuetan, et al.
Publicado: (2024)
por: Chu, Yuetan, et al.
Publicado: (2024)
SPG-CDENet: Spatial Prior-Guided Cross Dual Encoder Network for Multi-Organ Segmentation
por: Tian, Xizhi, et al.
Publicado: (2025)
por: Tian, Xizhi, et al.
Publicado: (2025)
Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation
por: Yang, Dongsheng, et al.
Publicado: (2026)
por: Yang, Dongsheng, et al.
Publicado: (2026)
Optimizing Breast Cancer Detection in Mammograms: A Comprehensive Study of Transfer Learning, Resolution Reduction, and Multi-View Classification
por: Petrini, Daniel G. P., et al.
Publicado: (2025)
por: Petrini, Daniel G. P., et al.
Publicado: (2025)
MetaFruit Meets Foundation Models: Leveraging a Comprehensive Multi-Fruit Dataset for Advancing Agricultural Foundation Models
por: Li, Jiajia, et al.
Publicado: (2024)
por: Li, Jiajia, et al.
Publicado: (2024)
BreastSegNet: Multi-label Segmentation of Breast MRI
por: Li, Qihang, et al.
Publicado: (2025)
por: Li, Qihang, et al.
Publicado: (2025)
FetalCLIP: A Visual-Language Foundation Model for Fetal Ultrasound Image Analysis
por: Maani, Fadillah, et al.
Publicado: (2025)
por: Maani, Fadillah, et al.
Publicado: (2025)
Inserting Faces inside Captions: Image Captioning with Attention Guided Merging
por: Tevissen, Yannis, et al.
Publicado: (2024)
por: Tevissen, Yannis, et al.
Publicado: (2024)
A comparative analysis of SRGAN models
por: Nikroo, Fatemeh Rezapoor, et al.
Publicado: (2023)
por: Nikroo, Fatemeh Rezapoor, et al.
Publicado: (2023)
Large-vocabulary forensic pathological analyses via prototypical cross-modal contrastive learning
por: Shen, Chen, et al.
Publicado: (2024)
por: Shen, Chen, et al.
Publicado: (2024)
CANAMRF: An Attention-Based Model for Multimodal Depression Detection
por: Wei, Yuntao, et al.
Publicado: (2024)
por: Wei, Yuntao, et al.
Publicado: (2024)
OrthoInsight: Rib Fracture Diagnosis and Report Generation Based on Multi-Modal Large Models
por: Wu, Ningyong, et al.
Publicado: (2025)
por: Wu, Ningyong, et al.
Publicado: (2025)
MAU-GPT: Enhancing Multi-type Industrial Anomaly Understanding via Anomaly-aware and Generalist Experts Adaptation
por: Wang, Zhuonan, et al.
Publicado: (2026)
por: Wang, Zhuonan, et al.
Publicado: (2026)
Vision Language Models in Medicine
por: Kalpelbe, Beria Chingnabe, et al.
Publicado: (2025)
por: Kalpelbe, Beria Chingnabe, et al.
Publicado: (2025)
FD-SOS: Vision-Language Open-Set Detectors for Bone Fenestration and Dehiscence Detection from Intraoral Images
por: Elbatel, Marawan, et al.
Publicado: (2024)
por: Elbatel, Marawan, et al.
Publicado: (2024)
Visual Question Answering in Ophthalmology: A Progressive and Practical Perspective
por: Chen, Xiaolan, et al.
Publicado: (2024)
por: Chen, Xiaolan, et al.
Publicado: (2024)
Ejemplares similares
-
Structured Prompting and Multi-Agent Knowledge Distillation for Traffic Video Interpretation and Risk Inference
por: Yang, Yunxiang, et al.
Publicado: (2025) -
Leveraging Scene Geometry and Depth Information for Robust Image Deraining
por: Xu, Ningning, et al.
Publicado: (2024) -
Enhancing autonomous vehicle safety in rain: a data-centric approach for clear vision
por: Seferian, Mark A., et al.
Publicado: (2024) -
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
por: Shi, Baorong, et al.
Publicado: (2026) -
Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding
por: Guo, Weiyu, et al.
Publicado: (2025)