DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zixuan, Khajavi, Siavash H., Jiang, Guangkai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models
por: Moshtaghi, Mehdi, et al.
Publicado: (2025)
por: Moshtaghi, Mehdi, et al.
Publicado: (2025)
Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment
por: Liu, Zixuan, et al.
Publicado: (2025)
por: Liu, Zixuan, et al.
Publicado: (2025)
Synthetic imagery for fuzzy object detection: A comparative study
por: Khajavi, Siavash H., et al.
Publicado: (2024)
por: Khajavi, Siavash H., et al.
Publicado: (2024)
Fire Dynamic Vision: Image Segmentation and Tracking for Multi-Scale Fire and Plume Behavior
por: Sagel, Daryn, et al.
Publicado: (2024)
por: Sagel, Daryn, et al.
Publicado: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
por: Yu, Haorui, et al.
Publicado: (2025)
por: Yu, Haorui, et al.
Publicado: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
por: Liang, Qiao, et al.
Publicado: (2025)
por: Liang, Qiao, et al.
Publicado: (2025)
Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
por: Zhang, Ming, et al.
Publicado: (2024)
por: Zhang, Ming, et al.
Publicado: (2024)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
por: Qin, Lixiong, et al.
Publicado: (2025)
por: Qin, Lixiong, et al.
Publicado: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
por: Madaan, Divyam, et al.
Publicado: (2025)
por: Madaan, Divyam, et al.
Publicado: (2025)
CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
por: Ung, Huy Quang, et al.
Publicado: (2025)
por: Ung, Huy Quang, et al.
Publicado: (2025)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
por: Li, Yanwei, et al.
Publicado: (2024)
por: Li, Yanwei, et al.
Publicado: (2024)
SCU-CGAN: Enhancing Fire Detection through Synthetic Fire Image Generation and Dataset Augmentation
por: Kim, Ju-Young, et al.
Publicado: (2025)
por: Kim, Ju-Young, et al.
Publicado: (2025)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models
por: Wu, Zixuan, et al.
Publicado: (2024)
por: Wu, Zixuan, et al.
Publicado: (2024)
FireRescue: A UAV-Based Dataset and Enhanced YOLO Model for Object Detection in Fire Rescue Scenes
por: Xu, Qingyu, et al.
Publicado: (2025)
por: Xu, Qingyu, et al.
Publicado: (2025)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
por: Ohi, Masanari, et al.
Publicado: (2024)
por: Ohi, Masanari, et al.
Publicado: (2024)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
por: Miao, Yongzhu, et al.
Publicado: (2023)
por: Miao, Yongzhu, et al.
Publicado: (2023)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
por: Dagan, Gautier, et al.
Publicado: (2024)
por: Dagan, Gautier, et al.
Publicado: (2024)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
por: Zang, Yuan, et al.
Publicado: (2025)
por: Zang, Yuan, et al.
Publicado: (2025)
GUIDE: A Guideline-Guided Dataset for Instructional Video Comprehension
por: Liang, Jiafeng, et al.
Publicado: (2024)
por: Liang, Jiafeng, et al.
Publicado: (2024)
SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model
por: Zhang, Yongting, et al.
Publicado: (2024)
por: Zhang, Yongting, et al.
Publicado: (2024)
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
por: Kouwenhoven, Tom, et al.
Publicado: (2025)
por: Kouwenhoven, Tom, et al.
Publicado: (2025)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
por: Feng, Jie, et al.
Publicado: (2025)
por: Feng, Jie, et al.
Publicado: (2025)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding
por: Zeng, Tong, et al.
Publicado: (2025)
por: Zeng, Tong, et al.
Publicado: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Vision-Language Models Do Not Understand Negation
por: Alhamoud, Kumail, et al.
Publicado: (2025)
por: Alhamoud, Kumail, et al.
Publicado: (2025)
Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation
por: Wang, Xintong, et al.
Publicado: (2025)
por: Wang, Xintong, et al.
Publicado: (2025)
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
por: Gong, Yunye, et al.
Publicado: (2023)
por: Gong, Yunye, et al.
Publicado: (2023)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
por: Zhu, Zifeng, et al.
Publicado: (2024)
por: Zhu, Zifeng, et al.
Publicado: (2024)
OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer
por: Zhang, Lu, et al.
Publicado: (2024)
por: Zhang, Lu, et al.
Publicado: (2024)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
por: Li, Zhaowei, et al.
Publicado: (2024)
por: Li, Zhaowei, et al.
Publicado: (2024)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
por: Xue, Wei, et al.
Publicado: (2023)
por: Xue, Wei, et al.
Publicado: (2023)
Ejemplares similares
-
RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models
por: Moshtaghi, Mehdi, et al.
Publicado: (2025) -
Targeting Misalignment: A Conflict-Aware Framework for Reward-Model-based LLM Alignment
por: Liu, Zixuan, et al.
Publicado: (2025) -
Synthetic imagery for fuzzy object detection: A comparative study
por: Khajavi, Siavash H., et al.
Publicado: (2024) -
Fire Dynamic Vision: Image Segmentation and Tracking for Multi-Scale Fire and Plume Behavior
por: Sagel, Daryn, et al.
Publicado: (2024) -
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
por: Wang, Yuxuan, et al.
Publicado: (2024)