A Multimodal RAG Framework for Housing Damage Assessment: Collaborative Optimization of Image Encoding and Policy Vector Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Miao, Jiayi, Lu, Dingxin, Wang, Zhuqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment
por: Karimi, Ehsan, et al.
Publicado: (2025)
por: Karimi, Ehsan, et al.
Publicado: (2025)
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
por: Zhu, Mengdan, et al.
Publicado: (2025)
por: Zhu, Mengdan, et al.
Publicado: (2025)
MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding
por: Huang, Runxi, et al.
Publicado: (2025)
por: Huang, Runxi, et al.
Publicado: (2025)
PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
por: Lee, Jeongjae, et al.
Publicado: (2025)
por: Lee, Jeongjae, et al.
Publicado: (2025)
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
por: Moon, Jihyun, et al.
Publicado: (2025)
por: Moon, Jihyun, et al.
Publicado: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
por: Xia, Peng, et al.
Publicado: (2025)
por: Xia, Peng, et al.
Publicado: (2025)
Multimodal RAG Enhanced Visual Description
por: Jaiswal, Amit Kumar, et al.
Publicado: (2025)
por: Jaiswal, Amit Kumar, et al.
Publicado: (2025)
Harmonizing Generalization and Specialization: Uncertainty-Informed Collaborative Learning for Semi-supervised Medical Image Segmentation
por: Lu, Wenjing, et al.
Publicado: (2025)
por: Lu, Wenjing, et al.
Publicado: (2025)
MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
por: Ha, Hyeonjeong, et al.
Publicado: (2025)
por: Ha, Hyeonjeong, et al.
Publicado: (2025)
Activation Function Optimization Scheme for Image Classification
por: Rahman, Abdur, et al.
Publicado: (2024)
por: Rahman, Abdur, et al.
Publicado: (2024)
Open Multimodal Retrieval-Augmented Factual Image Generation
por: Tian, Yang, et al.
Publicado: (2025)
por: Tian, Yang, et al.
Publicado: (2025)
DCL-SE: Dynamic Curriculum Learning for Spatiotemporal Encoding of Brain Imaging
por: Zhou, Meihua, et al.
Publicado: (2025)
por: Zhou, Meihua, et al.
Publicado: (2025)
PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series
por: Li, Haobo, et al.
Publicado: (2025)
por: Li, Haobo, et al.
Publicado: (2025)
Purrception: Variational Flow Matching for Vector-Quantized Image Generation
por: Matişan, Răzvan-Andrei, et al.
Publicado: (2025)
por: Matişan, Răzvan-Andrei, et al.
Publicado: (2025)
Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification
por: Zhu, Xun, et al.
Publicado: (2026)
por: Zhu, Xun, et al.
Publicado: (2026)
Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips
por: Galil, Ido, et al.
Publicado: (2025)
por: Galil, Ido, et al.
Publicado: (2025)
Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks
por: Matsuishi, Koki, et al.
Publicado: (2025)
por: Matsuishi, Koki, et al.
Publicado: (2025)
EncodeNet: A Framework for Boosting DNN Accuracy with Entropy-driven Generalized Converting Autoencoder
por: Mahmud, Hasanul, et al.
Publicado: (2024)
por: Mahmud, Hasanul, et al.
Publicado: (2024)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
por: Huang, Brandon, et al.
Publicado: (2024)
por: Huang, Brandon, et al.
Publicado: (2024)
COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control
por: Xia, Canming, et al.
Publicado: (2026)
por: Xia, Canming, et al.
Publicado: (2026)
I2MoE: Interpretable Multimodal Interaction-aware Mixture-of-Experts
por: Xin, Jiayi, et al.
Publicado: (2025)
por: Xin, Jiayi, et al.
Publicado: (2025)
A Wireless Collaborated Inference Acceleration Framework for Plant Disease Recognition
por: Zhu, Hele, et al.
Publicado: (2025)
por: Zhu, Hele, et al.
Publicado: (2025)
ArcVQ-VAE: A Spherical Vector Quantization Framework with ArcCosine Additive Margin
por: Kim, Jaeyung, et al.
Publicado: (2026)
por: Kim, Jaeyung, et al.
Publicado: (2026)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
por: Zhou, Renping, et al.
Publicado: (2025)
por: Zhou, Renping, et al.
Publicado: (2025)
No Labels Needed: Zero-Shot Image Classification with Collaborative Self-Learning
por: Todescato, Matheus Vinícius, et al.
Publicado: (2025)
por: Todescato, Matheus Vinícius, et al.
Publicado: (2025)
Scalable Whole Slide Image Representation Using K-Mean Clustering and Fisher Vector Aggregation
por: Gupta, Ravi Kant, et al.
Publicado: (2025)
por: Gupta, Ravi Kant, et al.
Publicado: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
Pilot: Building the Federated Multimodal Instruction Tuning Framework
por: Xiong, Baochen, et al.
Publicado: (2025)
por: Xiong, Baochen, et al.
Publicado: (2025)
A Cascading Cooperative Multi-agent Framework for On-ramp Merging Control Integrating Large Language Models
por: Zhang, Miao, et al.
Publicado: (2025)
por: Zhang, Miao, et al.
Publicado: (2025)
AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models
por: Li, Yuming, et al.
Publicado: (2026)
por: Li, Yuming, et al.
Publicado: (2026)
GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
por: Parast, Aryan Yazdan, et al.
Publicado: (2025)
por: Parast, Aryan Yazdan, et al.
Publicado: (2025)
Multitask Multimodal Self-Supervised Learning for Medical Images
por: Simionescu, Cristian
Publicado: (2025)
por: Simionescu, Cristian
Publicado: (2025)
FusionSF: Fuse Heterogeneous Modalities in a Vector Quantized Framework for Robust Solar Power Forecasting
por: Ma, Ziqing, et al.
Publicado: (2024)
por: Ma, Ziqing, et al.
Publicado: (2024)
Cross-modal Affinity-aligned Multimodal Learning Analytics for Predicting Student Collaboration Satisfaction in Game-Based Learning
por: Tsai, Wen-Hsin, et al.
Publicado: (2026)
por: Tsai, Wen-Hsin, et al.
Publicado: (2026)
Multi-Head Encoding for Extreme Label Classification
por: Liang, Daojun, et al.
Publicado: (2024)
por: Liang, Daojun, et al.
Publicado: (2024)
Evaluation Framework for Feedback Generation Methods in Skeletal Movement Assessment
por: Hakim, Tal
Publicado: (2024)
por: Hakim, Tal
Publicado: (2024)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
por: Hong, Minjie, et al.
Publicado: (2025)
por: Hong, Minjie, et al.
Publicado: (2025)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
por: Tang, Jiajin, et al.
Publicado: (2026)
por: Tang, Jiajin, et al.
Publicado: (2026)
PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training
por: Altuuaim, Sattam, et al.
Publicado: (2026)
por: Altuuaim, Sattam, et al.
Publicado: (2026)
TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment
por: Li, Jiaming, et al.
Publicado: (2026)
por: Li, Jiaming, et al.
Publicado: (2026)
Ejemplares similares
-
Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment
por: Karimi, Ehsan, et al.
Publicado: (2025) -
Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation
por: Zhu, Mengdan, et al.
Publicado: (2025) -
MMEdge: Accelerating On-device Multimodal Inference via Pipelined Sensing and Encoding
por: Huang, Runxi, et al.
Publicado: (2025) -
PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
por: Lee, Jeongjae, et al.
Publicado: (2025) -
Retrieval-Augmented VLMs for Multimodal Melanoma Diagnosis
por: Moon, Jihyun, et al.
Publicado: (2025)