A Multimodal RAG Framework for Housing Damage Assessment: Collaborative Optimization of Image Encoding and Policy Vector Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Miao, Jiayi, Lu, Dingxin, Wang, Zhuqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment
di: Karimi, Ehsan, et al.
Pubblicazione: (2025)
di: Karimi, Ehsan, et al.
Pubblicazione: (2025)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
di: Zhu, Mengdan, et al.
Pubblicazione: (2025)
di: Zhu, Mengdan, et al.
Pubblicazione: (2025)
MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding
di: Huang, Runxi, et al.
Pubblicazione: (2025)
di: Huang, Runxi, et al.
Pubblicazione: (2025)
PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
di: Lee, Jeongjae, et al.
Pubblicazione: (2025)
di: Lee, Jeongjae, et al.
Pubblicazione: (2025)
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
di: Moon, Jihyun, et al.
Pubblicazione: (2025)
di: Moon, Jihyun, et al.
Pubblicazione: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
di: Xia, Peng, et al.
Pubblicazione: (2025)
di: Xia, Peng, et al.
Pubblicazione: (2025)
Multimodal RAG Enhanced Visual Description
di: Jaiswal, Amit Kumar, et al.
Pubblicazione: (2025)
di: Jaiswal, Amit Kumar, et al.
Pubblicazione: (2025)
Harmonizing Generalization and Specialization: Uncertainty-Informed Collaborative Learning for Semi-supervised Medical Image Segmentation
di: Lu, Wenjing, et al.
Pubblicazione: (2025)
di: Lu, Wenjing, et al.
Pubblicazione: (2025)
MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
di: Ha, Hyeonjeong, et al.
Pubblicazione: (2025)
di: Ha, Hyeonjeong, et al.
Pubblicazione: (2025)
Activation Function Optimization Scheme for Image Classification
di: Rahman, Abdur, et al.
Pubblicazione: (2024)
di: Rahman, Abdur, et al.
Pubblicazione: (2024)
Open Multimodal Retrieval-Augmented Factual Image Generation
di: Tian, Yang, et al.
Pubblicazione: (2025)
di: Tian, Yang, et al.
Pubblicazione: (2025)
DCL-SE: Dynamic Curriculum Learning for Spatiotemporal Encoding of Brain Imaging
di: Zhou, Meihua, et al.
Pubblicazione: (2025)
di: Zhou, Meihua, et al.
Pubblicazione: (2025)
PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series
di: Li, Haobo, et al.
Pubblicazione: (2025)
di: Li, Haobo, et al.
Pubblicazione: (2025)
Purrception: Variational Flow Matching for Vector-Quantized Image Generation
di: Matişan, Răzvan-Andrei, et al.
Pubblicazione: (2025)
di: Matişan, Răzvan-Andrei, et al.
Pubblicazione: (2025)
Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification
di: Zhu, Xun, et al.
Pubblicazione: (2026)
di: Zhu, Xun, et al.
Pubblicazione: (2026)
Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips
di: Galil, Ido, et al.
Pubblicazione: (2025)
di: Galil, Ido, et al.
Pubblicazione: (2025)
Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks
di: Matsuishi, Koki, et al.
Pubblicazione: (2025)
di: Matsuishi, Koki, et al.
Pubblicazione: (2025)
EncodeNet: A Framework for Boosting DNN Accuracy with Entropy-driven Generalized Converting Autoencoder
di: Mahmud, Hasanul, et al.
Pubblicazione: (2024)
di: Mahmud, Hasanul, et al.
Pubblicazione: (2024)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
di: Huang, Brandon, et al.
Pubblicazione: (2024)
di: Huang, Brandon, et al.
Pubblicazione: (2024)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
di: Xia, Canming, et al.
Pubblicazione: (2026)
di: Xia, Canming, et al.
Pubblicazione: (2026)
I2MoE: Interpretable Multimodal Interaction-aware Mixture-of-Experts
di: Xin, Jiayi, et al.
Pubblicazione: (2025)
di: Xin, Jiayi, et al.
Pubblicazione: (2025)
A Wireless Collaborated Inference Acceleration Framework for Plant Disease Recognition
di: Zhu, Hele, et al.
Pubblicazione: (2025)
di: Zhu, Hele, et al.
Pubblicazione: (2025)
ArcVQ-VAE: A Spherical Vector Quantization Framework with ArcCosine Additive Margin
di: Kim, Jaeyung, et al.
Pubblicazione: (2026)
di: Kim, Jaeyung, et al.
Pubblicazione: (2026)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
di: Zhou, Renping, et al.
Pubblicazione: (2025)
di: Zhou, Renping, et al.
Pubblicazione: (2025)
No Labels Needed: Zero-Shot Image Classification with Collaborative Self-Learning
di: Todescato, Matheus Vinícius, et al.
Pubblicazione: (2025)
di: Todescato, Matheus Vinícius, et al.
Pubblicazione: (2025)
Scalable Whole Slide Image Representation Using K-Mean Clustering and Fisher Vector Aggregation
di: Gupta, Ravi Kant, et al.
Pubblicazione: (2025)
di: Gupta, Ravi Kant, et al.
Pubblicazione: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
di: Zhang, Jingyi, et al.
Pubblicazione: (2025)
di: Zhang, Jingyi, et al.
Pubblicazione: (2025)
Pilot: Building the Federated Multimodal Instruction Tuning Framework
di: Xiong, Baochen, et al.
Pubblicazione: (2025)
di: Xiong, Baochen, et al.
Pubblicazione: (2025)
A Cascading Cooperative Multi-agent Framework for On-ramp Merging Control Integrating Large Language Models
di: Zhang, Miao, et al.
Pubblicazione: (2025)
di: Zhang, Miao, et al.
Pubblicazione: (2025)
AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models
di: Li, Yuming, et al.
Pubblicazione: (2026)
di: Li, Yuming, et al.
Pubblicazione: (2026)
GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
di: Parast, Aryan Yazdan, et al.
Pubblicazione: (2025)
di: Parast, Aryan Yazdan, et al.
Pubblicazione: (2025)
Multitask Multimodal Self-Supervised Learning for Medical Images
di: Simionescu, Cristian
Pubblicazione: (2025)
di: Simionescu, Cristian
Pubblicazione: (2025)
FusionSF: Fuse Heterogeneous Modalities in a Vector Quantized Framework for Robust Solar Power Forecasting
di: Ma, Ziqing, et al.
Pubblicazione: (2024)
di: Ma, Ziqing, et al.
Pubblicazione: (2024)
Cross-modal Affinity-aligned Multimodal Learning Analytics for Predicting Student Collaboration Satisfaction in Game-Based Learning
di: Tsai, Wen-Hsin, et al.
Pubblicazione: (2026)
di: Tsai, Wen-Hsin, et al.
Pubblicazione: (2026)
Multi-Head Encoding for Extreme Label Classification
di: Liang, Daojun, et al.
Pubblicazione: (2024)
di: Liang, Daojun, et al.
Pubblicazione: (2024)
Evaluation Framework for Feedback Generation Methods in Skeletal Movement Assessment
di: Hakim, Tal
Pubblicazione: (2024)
di: Hakim, Tal
Pubblicazione: (2024)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
di: Hong, Minjie, et al.
Pubblicazione: (2025)
di: Hong, Minjie, et al.
Pubblicazione: (2025)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
di: Tang, Jiajin, et al.
Pubblicazione: (2026)
di: Tang, Jiajin, et al.
Pubblicazione: (2026)
PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training
di: Altuuaim, Sattam, et al.
Pubblicazione: (2026)
di: Altuuaim, Sattam, et al.
Pubblicazione: (2026)
TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment
di: Li, Jiaming, et al.
Pubblicazione: (2026)
di: Li, Jiaming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment
di: Karimi, Ehsan, et al.
Pubblicazione: (2025) -
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
di: Zhu, Mengdan, et al.
Pubblicazione: (2025) -
MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding
di: Huang, Runxi, et al.
Pubblicazione: (2025) -
PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
di: Lee, Jeongjae, et al.
Pubblicazione: (2025) -
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
di: Moon, Jihyun, et al.
Pubblicazione: (2025)