Hard Cases Detection in Motion Prediction by Vision-Language Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yi, Zhang, Qingwen, Ikemura, Kei, Batool, Nazre, Folkesson, John |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoScale: Linear Scalarization Guided by Multi-Task Optimization Metrics
por: Yang, Yi, et al.
Publicado: (2025)
por: Yang, Yi, et al.
Publicado: (2025)
Score-Based Multibeam Point Cloud Denoising
por: Ling, Li, et al.
Publicado: (2024)
por: Ling, Li, et al.
Publicado: (2024)
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
por: Cui, Peng, et al.
Publicado: (2024)
por: Cui, Peng, et al.
Publicado: (2024)
Vision Foundation Model Embedding-Based Semantic Anomaly Detection
por: Ronecker, Max Peter, et al.
Publicado: (2025)
por: Ronecker, Max Peter, et al.
Publicado: (2025)
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
por: Huang, Xin, et al.
Publicado: (2025)
por: Huang, Xin, et al.
Publicado: (2025)
RadFlag: A Black-Box Hallucination Detection Method for Medical Vision Language Models
por: Zhang, Serena, et al.
Publicado: (2024)
por: Zhang, Serena, et al.
Publicado: (2024)
FLAVARS: A Multimodal Foundational Language and Vision Alignment Model for Remote Sensing
por: Corley, Isaac, et al.
Publicado: (2025)
por: Corley, Isaac, et al.
Publicado: (2025)
CellVTA: Enhancing Vision Foundation Models for Accurate Cell Segmentation and Classification
por: Yang, Yang, et al.
Publicado: (2025)
por: Yang, Yang, et al.
Publicado: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
Detecting and Preventing Hallucinations in Large Vision Language Models
por: Gunjal, Anisha, et al.
Publicado: (2023)
por: Gunjal, Anisha, et al.
Publicado: (2023)
Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model
por: Cao, Bin, et al.
Publicado: (2025)
por: Cao, Bin, et al.
Publicado: (2025)
Calibrated and Robust Foundation Models for Vision-Language and Medical Image Tasks Under Distribution Shift
por: Khan, Behraj, et al.
Publicado: (2025)
por: Khan, Behraj, et al.
Publicado: (2025)
MoFM: A Large-Scale Human Motion Foundation Model
por: Baharani, Mohammadreza, et al.
Publicado: (2025)
por: Baharani, Mohammadreza, et al.
Publicado: (2025)
VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
por: Bi, Tianci, et al.
Publicado: (2025)
por: Bi, Tianci, et al.
Publicado: (2025)
Structuring GUI Elements through Vision Language Models: Towards Action Space Generation
por: Xu, Yi, et al.
Publicado: (2025)
por: Xu, Yi, et al.
Publicado: (2025)
Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations
por: Babadi, Narges, et al.
Publicado: (2026)
por: Babadi, Narges, et al.
Publicado: (2026)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
por: Bao, Chen, et al.
Publicado: (2024)
por: Bao, Chen, et al.
Publicado: (2024)
Vision Foundation Models in Remote Sensing: A Survey
por: Lu, Siqi, et al.
Publicado: (2024)
por: Lu, Siqi, et al.
Publicado: (2024)
Revisiting Active Learning in the Era of Vision Foundation Models
por: Gupte, Sanket Rajan, et al.
Publicado: (2024)
por: Gupte, Sanket Rajan, et al.
Publicado: (2024)
CFM: Language-aligned Concept Foundation Model for Vision
por: Wittenmayer, Kai, et al.
Publicado: (2026)
por: Wittenmayer, Kai, et al.
Publicado: (2026)
Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
Negative Label Guided OOD Detection with Pretrained Vision-Language Models
por: Jiang, Xue, et al.
Publicado: (2024)
por: Jiang, Xue, et al.
Publicado: (2024)
Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method
por: Pan, Bikang, et al.
Publicado: (2024)
por: Pan, Bikang, et al.
Publicado: (2024)
Bridging Vision and Language Spaces with Assignment Prediction
por: Park, Jungin, et al.
Publicado: (2024)
por: Park, Jungin, et al.
Publicado: (2024)
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
por: Ding, Yi, et al.
Publicado: (2024)
por: Ding, Yi, et al.
Publicado: (2024)
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
Continuous Object State Recognition for Cooking Robots Using Pre-Trained Vision-Language Models and Black-box Optimization
por: Kawaharazuka, Kento, et al.
Publicado: (2024)
por: Kawaharazuka, Kento, et al.
Publicado: (2024)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
por: Jiang, Yitong, et al.
Publicado: (2026)
por: Jiang, Yitong, et al.
Publicado: (2026)
Towards Long-Range 3D Object Detection for Autonomous Vehicles
por: Khoche, Ajinkya, et al.
Publicado: (2023)
por: Khoche, Ajinkya, et al.
Publicado: (2023)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
por: Yi, Chao, et al.
Publicado: (2024)
por: Yi, Chao, et al.
Publicado: (2024)
HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models
por: Zohrabi, Reihaneh, et al.
Publicado: (2026)
por: Zohrabi, Reihaneh, et al.
Publicado: (2026)
Neutral-Reference Prompting for Vision-Language Models
por: Tian, Senmao, et al.
Publicado: (2026)
por: Tian, Senmao, et al.
Publicado: (2026)
AdaVFM: Adaptive Vision Foundation Models for Edge Intelligence via LLM-Guided Execution
por: Zhao, Yiwei, et al.
Publicado: (2026)
por: Zhao, Yiwei, et al.
Publicado: (2026)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
por: Fu, Deqing, et al.
Publicado: (2024)
por: Fu, Deqing, et al.
Publicado: (2024)
You Never Know: Quantization Induces Inconsistent Biases in Vision-Language Foundation Models
por: Slyman, Eric, et al.
Publicado: (2024)
por: Slyman, Eric, et al.
Publicado: (2024)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
por: Ding, Yi, et al.
Publicado: (2026)
por: Ding, Yi, et al.
Publicado: (2026)
Pedestrian Intention Prediction via Vision-Language Foundation Models
por: Azarmi, Mohsen, et al.
Publicado: (2025)
por: Azarmi, Mohsen, et al.
Publicado: (2025)
VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones
por: Shen, Lefei, et al.
Publicado: (2025)
por: Shen, Lefei, et al.
Publicado: (2025)
Vision Language Models are Biased
por: Vo, An, et al.
Publicado: (2025)
por: Vo, An, et al.
Publicado: (2025)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Ejemplares similares
-
AutoScale: Linear Scalarization Guided by Multi-Task Optimization Metrics
por: Yang, Yi, et al.
Publicado: (2025) -
Score-Based Multibeam Point Cloud Denoising
por: Ling, Li, et al.
Publicado: (2024) -
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
por: Cui, Peng, et al.
Publicado: (2024) -
Vision Foundation Model Embedding-Based Semantic Anomaly Detection
por: Ronecker, Max Peter, et al.
Publicado: (2025) -
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
por: Huang, Xin, et al.
Publicado: (2025)