Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
Fuente:
arXiv
Guardado en:
| Autor principal: | Lin, Yu-Hsuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models
por: Szu-Tu, Li-Zhong, et al.
Publicado: (2025)
por: Szu-Tu, Li-Zhong, et al.
Publicado: (2025)
Interpretable Vision-Language Survival Analysis with Ordinal Inductive Bias for Computational Pathology
por: Liu, Pei, et al.
Publicado: (2024)
por: Liu, Pei, et al.
Publicado: (2024)
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
por: Ullah, Zahid, et al.
Publicado: (2025)
por: Ullah, Zahid, et al.
Publicado: (2025)
OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models
por: Tozaki, Yusuke, et al.
Publicado: (2026)
por: Tozaki, Yusuke, et al.
Publicado: (2026)
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
por: Lv, Weiyi, et al.
Publicado: (2025)
por: Lv, Weiyi, et al.
Publicado: (2025)
Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision
por: Lu, Qiang, et al.
Publicado: (2025)
por: Lu, Qiang, et al.
Publicado: (2025)
CLOC: Contrastive Learning for Ordinal Classification with Multi-Margin N-pair Loss
por: Pitawela, Dileepa, et al.
Publicado: (2025)
por: Pitawela, Dileepa, et al.
Publicado: (2025)
A Vision-Based Analysis of Congestion Pricing in New York City
por: Turkcan, Mehmet Kerem, et al.
Publicado: (2026)
por: Turkcan, Mehmet Kerem, et al.
Publicado: (2026)
EgoLM: Multi-Modal Language Model of Egocentric Motions
por: Hong, Fangzhou, et al.
Publicado: (2024)
por: Hong, Fangzhou, et al.
Publicado: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
Multi-Modal Instruction-Tuning Small-Scale Language-and-Vision Assistant for Semiconductor Electron Micrograph Analysis
por: Srinivas, Sakhinana Sagar, et al.
Publicado: (2024)
por: Srinivas, Sakhinana Sagar, et al.
Publicado: (2024)
VORD: Visual Ordinal Calibration for Mitigating Object Hallucinations in Large Vision-Language Models
por: Neo, Dexter, et al.
Publicado: (2024)
por: Neo, Dexter, et al.
Publicado: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
por: Zhang, Mingyuan, et al.
Publicado: (2024)
por: Zhang, Mingyuan, et al.
Publicado: (2024)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
por: Imran, Muhammad, et al.
Publicado: (2025)
por: Imran, Muhammad, et al.
Publicado: (2025)
M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2026)
por: Symeonidis-Herzig, Alexandre, et al.
Publicado: (2026)
MultiMedVision: Multi-Modal Medical Vision Framework
por: Li, Frank, et al.
Publicado: (2026)
por: Li, Frank, et al.
Publicado: (2026)
Exploring Vision Transformers for 3D Human Motion-Language Models with Motion Patches
por: Yu, Qing, et al.
Publicado: (2024)
por: Yu, Qing, et al.
Publicado: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
por: Ouyang, Shuyi, et al.
Publicado: (2024)
por: Ouyang, Shuyi, et al.
Publicado: (2024)
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
por: Cheng, Silin, et al.
Publicado: (2025)
por: Cheng, Silin, et al.
Publicado: (2025)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
por: Chen, Kaixiang, et al.
Publicado: (2026)
por: Chen, Kaixiang, et al.
Publicado: (2026)
DMS-Net:Dual-Modal Multi-Scale Siamese Network for Binocular Fundus Image Classification
por: Huo, Guohao, et al.
Publicado: (2025)
por: Huo, Guohao, et al.
Publicado: (2025)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
por: Guo, Zhenhao, et al.
Publicado: (2025)
por: Guo, Zhenhao, et al.
Publicado: (2025)
ELEV-VISION-SAM: Integrated Vision Language and Foundation Model for Automated Estimation of Building Lowest Floor Elevation
por: Ho, Yu-Hsuan, et al.
Publicado: (2024)
por: Ho, Yu-Hsuan, et al.
Publicado: (2024)
DIOR-ViT: Differential Ordinal Learning Vision Transformer for Cancer Classification in Pathology Images
por: Lee, Ju Cheon, et al.
Publicado: (2024)
por: Lee, Ju Cheon, et al.
Publicado: (2024)
SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
por: Zhou, Xingcheng, et al.
Publicado: (2026)
por: Zhou, Xingcheng, et al.
Publicado: (2026)
Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
por: Yan, Xiaoshuo, et al.
Publicado: (2025)
por: Yan, Xiaoshuo, et al.
Publicado: (2025)
Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space
por: Yu, Shiyao, et al.
Publicado: (2025)
por: Yu, Shiyao, et al.
Publicado: (2025)
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
por: Bakkali, Souhail, et al.
Publicado: (2023)
por: Bakkali, Souhail, et al.
Publicado: (2023)
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
por: Ding, Henghui, et al.
Publicado: (2025)
por: Ding, Henghui, et al.
Publicado: (2025)
Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
por: Ling, Lu, et al.
Publicado: (2025)
por: Ling, Lu, et al.
Publicado: (2025)
GPT-4V as Traffic Assistant: An In-depth Look at Vision Language Model on Complex Traffic Events
por: Zhou, Xingcheng, et al.
Publicado: (2024)
por: Zhou, Xingcheng, et al.
Publicado: (2024)
Trustworthy Multimodal Fusion for Sentiment Analysis in Ordinal Sentiment Space
por: Xie, Zhuyang, et al.
Publicado: (2024)
por: Xie, Zhuyang, et al.
Publicado: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
A Deep Ordinal Distortion Estimation Approach for Distortion Rectification
por: Liao, Kang, et al.
Publicado: (2020)
por: Liao, Kang, et al.
Publicado: (2020)
Majorization-Guided Test-Time Adaptation for Vision-Language Models under Modality-Specific Shift
por: Chen, Lixian, et al.
Publicado: (2026)
por: Chen, Lixian, et al.
Publicado: (2026)
Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
por: Truong, Thanh-Dat, et al.
Publicado: (2025)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
por: Guo, Xiao, et al.
Publicado: (2025)
por: Guo, Xiao, et al.
Publicado: (2025)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
por: Hou, Ruibing, et al.
Publicado: (2026)
por: Hou, Ruibing, et al.
Publicado: (2026)
Ejemplares similares
-
Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models
por: Szu-Tu, Li-Zhong, et al.
Publicado: (2025) -
Interpretable Vision-Language Survival Analysis with Ordinal Inductive Bias for Computational Pathology
por: Liu, Pei, et al.
Publicado: (2024) -
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
por: Ullah, Zahid, et al.
Publicado: (2025) -
OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models
por: Tozaki, Yusuke, et al.
Publicado: (2026) -
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models
por: Lv, Weiyi, et al.
Publicado: (2025)