SDIGLM: Leveraging Large Language Models and Multi-Modal Chain of Thought for Structural Damage Identification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Yunkai, Wei, Shiyin, Huang, Yong, Su, Yawu, Lu, Shanshan, Li, Hui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
von: Kim, Dahun, et al.
Veröffentlicht: (2026)
von: Kim, Dahun, et al.
Veröffentlicht: (2026)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
von: Shao, Hao, et al.
Veröffentlicht: (2024)
von: Shao, Hao, et al.
Veröffentlicht: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
von: Wu, Qiong, et al.
Veröffentlicht: (2025)
Chain-of-Anomaly Thoughts with Large Vision-Language Models
von: Domingos, Pedro, et al.
Veröffentlicht: (2025)
von: Domingos, Pedro, et al.
Veröffentlicht: (2025)
MammothModa: Multi-Modal Large Language Model
von: She, Qi, et al.
Veröffentlicht: (2024)
von: She, Qi, et al.
Veröffentlicht: (2024)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
von: Jiang, Jingjing, et al.
Veröffentlicht: (2025)
von: Jiang, Jingjing, et al.
Veröffentlicht: (2025)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
von: Zhao, Han, et al.
Veröffentlicht: (2024)
von: Zhao, Han, et al.
Veröffentlicht: (2024)
CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation
von: Zhang, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhang, Guanghao, et al.
Veröffentlicht: (2025)
A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models
von: Huang, Hao, et al.
Veröffentlicht: (2025)
von: Huang, Hao, et al.
Veröffentlicht: (2025)
Interleaved-Modal Chain-of-Thought
von: Gao, Jun, et al.
Veröffentlicht: (2024)
von: Gao, Jun, et al.
Veröffentlicht: (2024)
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
von: Zhang, Honglu, et al.
Veröffentlicht: (2025)
von: Zhang, Honglu, et al.
Veröffentlicht: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
von: Ma, Qihang, et al.
Veröffentlicht: (2025)
von: Ma, Qihang, et al.
Veröffentlicht: (2025)
Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models
von: Yang, Yuedong, et al.
Veröffentlicht: (2026)
von: Yang, Yuedong, et al.
Veröffentlicht: (2026)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
von: Qiu, Han, et al.
Veröffentlicht: (2024)
von: Qiu, Han, et al.
Veröffentlicht: (2024)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
von: Nie, Jiahao, et al.
Veröffentlicht: (2024)
von: Nie, Jiahao, et al.
Veröffentlicht: (2024)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
von: Sinha, Sanchit, et al.
Veröffentlicht: (2026)
von: Sinha, Sanchit, et al.
Veröffentlicht: (2026)
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
von: Cheng, Zihui, et al.
Veröffentlicht: (2024)
von: Cheng, Zihui, et al.
Veröffentlicht: (2024)
AsyMoE: Leveraging Modal Asymmetry for Enhanced Expert Specialization in Large Vision-Language Models
von: Zhang, Heng, et al.
Veröffentlicht: (2025)
von: Zhang, Heng, et al.
Veröffentlicht: (2025)
LLMGA: Multimodal Large Language Model based Generation Assistant
von: Xia, Bin, et al.
Veröffentlicht: (2023)
von: Xia, Bin, et al.
Veröffentlicht: (2023)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
von: Ma, Ji, et al.
Veröffentlicht: (2026)
von: Ma, Ji, et al.
Veröffentlicht: (2026)
S-Chain: Structured Visual Chain-of-Thought For Medicine
von: Le-Duc, Khai, et al.
Veröffentlicht: (2025)
von: Le-Duc, Khai, et al.
Veröffentlicht: (2025)
Leveraging Large Language Models for Multimodal Search
von: Barbany, Oriol, et al.
Veröffentlicht: (2024)
von: Barbany, Oriol, et al.
Veröffentlicht: (2024)
CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models
von: Siddique, Md. Abu Bakor, et al.
Veröffentlicht: (2026)
von: Siddique, Md. Abu Bakor, et al.
Veröffentlicht: (2026)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
von: Yan, Hanqi, et al.
Veröffentlicht: (2025)
von: Yan, Hanqi, et al.
Veröffentlicht: (2025)
Semantic-Guided Natural Language and Visual Fusion for Cross-Modal Interaction Based on Tiny Object Detection
von: Huang, Xian-Hong, et al.
Veröffentlicht: (2025)
von: Huang, Xian-Hong, et al.
Veröffentlicht: (2025)
Building-Guided Pseudo-Label Learning for Cross-Modal Building Damage Mapping
von: Li, Jiepan, et al.
Veröffentlicht: (2025)
von: Li, Jiepan, et al.
Veröffentlicht: (2025)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
von: Xu, Jinjin, et al.
Veröffentlicht: (2023)
von: Xu, Jinjin, et al.
Veröffentlicht: (2023)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
von: Chen, Kaixiang, et al.
Veröffentlicht: (2026)
von: Chen, Kaixiang, et al.
Veröffentlicht: (2026)
Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
von: Pham, Tan-Hanh, et al.
Veröffentlicht: (2025)
von: Pham, Tan-Hanh, et al.
Veröffentlicht: (2025)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
von: Huo, Yu, et al.
Veröffentlicht: (2026)
von: Huo, Yu, et al.
Veröffentlicht: (2026)
VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
von: Duan, Haodong, et al.
Veröffentlicht: (2024)
von: Duan, Haodong, et al.
Veröffentlicht: (2024)
MV2DFusion: Leveraging Modality-Specific Object Semantics for Multi-Modal 3D Detection
von: Wang, Zitian, et al.
Veröffentlicht: (2024)
von: Wang, Zitian, et al.
Veröffentlicht: (2024)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
von: Wang, Yu, et al.
Veröffentlicht: (2024)
von: Wang, Yu, et al.
Veröffentlicht: (2024)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
von: Shi, Min, et al.
Veröffentlicht: (2025)
von: Shi, Min, et al.
Veröffentlicht: (2025)
RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding
von: Wu, Jiahe, et al.
Veröffentlicht: (2026)
von: Wu, Jiahe, et al.
Veröffentlicht: (2026)
ArgusCogito: Chain-of-Thought for Cross-Modal Synergy and Omnidirectional Reasoning in Camouflaged Object Segmentation
von: Tan, Jianwen, et al.
Veröffentlicht: (2025)
von: Tan, Jianwen, et al.
Veröffentlicht: (2025)
X-Fusion: Introducing New Modality to Frozen Large Language Models
von: Mo, Sicheng, et al.
Veröffentlicht: (2025)
von: Mo, Sicheng, et al.
Veröffentlicht: (2025)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
von: Leng, Sicong, et al.
Veröffentlicht: (2024)
von: Leng, Sicong, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
von: Kim, Dahun, et al.
Veröffentlicht: (2026) -
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
von: Shao, Hao, et al.
Veröffentlicht: (2024) -
Grounded Chain-of-Thought for Multimodal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2025) -
Chain-of-Anomaly Thoughts with Large Vision-Language Models
von: Domingos, Pedro, et al.
Veröffentlicht: (2025) -
MammothModa: Multi-Modal Large Language Model
von: She, Qi, et al.
Veröffentlicht: (2024)