Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
Fuente:
arXiv
Salvato in:
| Autore principale: | Lin, Yu-Hsuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models
di: Szu-Tu, Li-Zhong, et al.
Pubblicazione: (2025)
di: Szu-Tu, Li-Zhong, et al.
Pubblicazione: (2025)
Interpretable Vision-Language Survival Analysis with Ordinal Inductive Bias for Computational Pathology
di: Liu, Pei, et al.
Pubblicazione: (2024)
di: Liu, Pei, et al.
Pubblicazione: (2024)
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models
di: Tozaki, Yusuke, et al.
Pubblicazione: (2026)
di: Tozaki, Yusuke, et al.
Pubblicazione: (2026)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
di: Lv, Weiyi, et al.
Pubblicazione: (2025)
di: Lv, Weiyi, et al.
Pubblicazione: (2025)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
di: Lu, Qiang, et al.
Pubblicazione: (2025)
di: Lu, Qiang, et al.
Pubblicazione: (2025)
CLOC: Contrastive Learning for Ordinal Classification with Multi-Margin N-pair Loss
di: Pitawela, Dileepa, et al.
Pubblicazione: (2025)
di: Pitawela, Dileepa, et al.
Pubblicazione: (2025)
A Vision-Based Analysis of Congestion Pricing in New York City
di: Turkcan, Mehmet Kerem, et al.
Pubblicazione: (2026)
di: Turkcan, Mehmet Kerem, et al.
Pubblicazione: (2026)
EgoLM: Multi-Modal Language Model of Egocentric Motions
di: Hong, Fangzhou, et al.
Pubblicazione: (2024)
di: Hong, Fangzhou, et al.
Pubblicazione: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Multi-Modal Instruction-Tuning Small-Scale Language-and-Vision Assistant for Semiconductor Electron Micrograph Analysis
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
VORD: Visual Ordinal Calibration for Mitigating Object Hallucinations in Large Vision-Language Models
di: Neo, Dexter, et al.
Pubblicazione: (2024)
di: Neo, Dexter, et al.
Pubblicazione: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
di: Zhang, Mingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2024)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production
di: Symeonidis-Herzig, Alexandre, et al.
Pubblicazione: (2026)
di: Symeonidis-Herzig, Alexandre, et al.
Pubblicazione: (2026)
MultiMedVision: Multi-Modal Medical Vision Framework
di: Li, Frank, et al.
Pubblicazione: (2026)
di: Li, Frank, et al.
Pubblicazione: (2026)
Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches
di: Yu, Qing, et al.
Pubblicazione: (2024)
di: Yu, Qing, et al.
Pubblicazione: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
di: Ouyang, Shuyi, et al.
Pubblicazione: (2024)
di: Ouyang, Shuyi, et al.
Pubblicazione: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
di: Cheng, Silin, et al.
Pubblicazione: (2025)
di: Cheng, Silin, et al.
Pubblicazione: (2025)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
di: Chen, Kaixiang, et al.
Pubblicazione: (2026)
DMS-Net:Dual-Modal Multi-Scale Siamese Network for Binocular Fundus Image Classification
di: Huo, Guohao, et al.
Pubblicazione: (2025)
di: Huo, Guohao, et al.
Pubblicazione: (2025)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
di: Guo, Zhenhao, et al.
Pubblicazione: (2025)
di: Guo, Zhenhao, et al.
Pubblicazione: (2025)
ELEV-VISION-SAM: Integrated Vision Language and Foundation Model for Automated Estimation of Building Lowest Floor Elevation
di: Ho, Yu-Hsuan, et al.
Pubblicazione: (2024)
di: Ho, Yu-Hsuan, et al.
Pubblicazione: (2024)
DIOR-ViT: Differential Ordinal Learning Vision Transformer for Cancer Classification in Pathology Images
di: Lee, Ju Cheon, et al.
Pubblicazione: (2024)
di: Lee, Ju Cheon, et al.
Pubblicazione: (2024)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
di: Zhou, Xingcheng, et al.
Pubblicazione: (2026)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2026)
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
di: Yan, Xiaoshuo, et al.
Pubblicazione: (2025)
di: Yan, Xiaoshuo, et al.
Pubblicazione: (2025)
Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space
di: Yu, Shiyao, et al.
Pubblicazione: (2025)
di: Yu, Shiyao, et al.
Pubblicazione: (2025)
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
di: Bakkali, Souhail, et al.
Pubblicazione: (2023)
di: Bakkali, Souhail, et al.
Pubblicazione: (2023)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
di: Ding, Henghui, et al.
Pubblicazione: (2025)
di: Ding, Henghui, et al.
Pubblicazione: (2025)
Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
di: Ling, Lu, et al.
Pubblicazione: (2025)
di: Ling, Lu, et al.
Pubblicazione: (2025)
GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2024)
Trustworthy Multimodal Fusion for Sentiment Analysis in Ordinal Sentiment Space
di: Xie, Zhuyang, et al.
Pubblicazione: (2024)
di: Xie, Zhuyang, et al.
Pubblicazione: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
A Deep Ordinal Distortion Estimation Approach for Distortion Rectification
di: Liao, Kang, et al.
Pubblicazione: (2020)
di: Liao, Kang, et al.
Pubblicazione: (2020)
Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift
di: Chen, Lixian, et al.
Pubblicazione: (2026)
di: Chen, Lixian, et al.
Pubblicazione: (2026)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2025)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2025)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
di: Guo, Xiao, et al.
Pubblicazione: (2025)
di: Guo, Xiao, et al.
Pubblicazione: (2025)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
di: Lei, Xuanyu, et al.
Pubblicazione: (2024)
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
di: Hou, Ruibing, et al.
Pubblicazione: (2026)
di: Hou, Ruibing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models
di: Szu-Tu, Li-Zhong, et al.
Pubblicazione: (2025) -
Interpretable Vision-Language Survival Analysis with Ordinal Inductive Bias for Computational Pathology
di: Liu, Pei, et al.
Pubblicazione: (2024) -
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
di: Ullah, Zahid, et al.
Pubblicazione: (2025) -
OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models
di: Tozaki, Yusuke, et al.
Pubblicazione: (2026) -
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
di: Lv, Weiyi, et al.
Pubblicazione: (2025)