Solar-VLM: Multimodal Vision-Language Models for Augmented Solar Power Forecasting
Fuente:
arXiv
Guardado en:
| Autores principales: | Fan, Hang, Pei, Haoran, Liang, Runze, Liu, Weican, Cheng, Long, Wei, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
por: Liu, Hanqing, et al.
Publicado: (2026)
por: Liu, Hanqing, et al.
Publicado: (2026)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
por: Xu, Wanting, et al.
Publicado: (2024)
por: Xu, Wanting, et al.
Publicado: (2024)
HumanVLM: Foundation for Human-Scene Vision-Language Model
por: Dai, Dawei, et al.
Publicado: (2024)
por: Dai, Dawei, et al.
Publicado: (2024)
Multimodal Forecasting of Sparse Intraoperative Hypotension Events Powered by Language Model
por: Zhang, Jintao, et al.
Publicado: (2025)
por: Zhang, Jintao, et al.
Publicado: (2025)
TrumorGPT: Graph-Based Retrieval-Augmented Large Language Model for Fact-Checking
por: Hang, Ching Nam, et al.
Publicado: (2025)
por: Hang, Ching Nam, et al.
Publicado: (2025)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
por: Wu, Qinzhuo, et al.
Publicado: (2024)
por: Wu, Qinzhuo, et al.
Publicado: (2024)
A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks
por: Liang, Chia Xin, et al.
Publicado: (2024)
por: Liang, Chia Xin, et al.
Publicado: (2024)
RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
por: Liao, Dacheng, et al.
Publicado: (2025)
por: Liao, Dacheng, et al.
Publicado: (2025)
CF-VLM:CounterFactual Vision-Language Fine-tuning
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
SolarTformer: A Transformer Based Deep Learning Approach for Short Term Solar Power Forecasting
por: Basu, Ankan, et al.
Publicado: (2026)
por: Basu, Ankan, et al.
Publicado: (2026)
FastVLM: Efficient Vision Encoding for Vision Language Models
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
por: Vasu, Pavan Kumar Anasosalu, et al.
Publicado: (2024)
VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation
por: Kim, Junyoung, et al.
Publicado: (2026)
por: Kim, Junyoung, et al.
Publicado: (2026)
DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
por: Meng, Zijie, et al.
Publicado: (2025)
por: Meng, Zijie, et al.
Publicado: (2025)
MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs
por: Wan, Xueyao, et al.
Publicado: (2025)
por: Wan, Xueyao, et al.
Publicado: (2025)
VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models
por: Valencia, Ty, et al.
Publicado: (2026)
por: Valencia, Ty, et al.
Publicado: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
por: Huang, Mingzhe, et al.
Publicado: (2026)
por: Huang, Mingzhe, et al.
Publicado: (2026)
AppVLM: A Lightweight Vision Language Model for Online App Control
por: Papoudakis, Georgios, et al.
Publicado: (2025)
por: Papoudakis, Georgios, et al.
Publicado: (2025)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
por: Wei, Ziming, et al.
Publicado: (2025)
por: Wei, Ziming, et al.
Publicado: (2025)
MobileVLM V2: Faster and Stronger Baseline for Vision Language Model
por: Chu, Xiangxiang, et al.
Publicado: (2024)
por: Chu, Xiangxiang, et al.
Publicado: (2024)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
por: Jiang, Ziyan, et al.
Publicado: (2024)
por: Jiang, Ziyan, et al.
Publicado: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
por: Zhang, Jianke, et al.
Publicado: (2026)
por: Zhang, Jianke, et al.
Publicado: (2026)
Probabilistic Multi-Regional Solar Power Forecasting with Any-Quantile Recurrent Neural Networks
por: Smyl, Slawek, et al.
Publicado: (2026)
por: Smyl, Slawek, et al.
Publicado: (2026)
LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models
por: Sun, Fan-Yun, et al.
Publicado: (2024)
por: Sun, Fan-Yun, et al.
Publicado: (2024)
Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
por: Zhu, Qihui, et al.
Publicado: (2026)
por: Zhu, Qihui, et al.
Publicado: (2026)
Augment or Not? A Comparative Study of Pure and Augmented Large Language Model Recommenders
por: Huang, Wei-Hsiang, et al.
Publicado: (2025)
por: Huang, Wei-Hsiang, et al.
Publicado: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
por: Chen, Pingyi, et al.
Publicado: (2025)
por: Chen, Pingyi, et al.
Publicado: (2025)
AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models
por: Han, Yuxuan, et al.
Publicado: (2026)
por: Han, Yuxuan, et al.
Publicado: (2026)
Integrating Weather Foundation Model and Satellite to Enable Fine-Grained Solar Irradiance Forecasting
por: Ma, Ziqing, et al.
Publicado: (2026)
por: Ma, Ziqing, et al.
Publicado: (2026)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
por: Chen, Zhuo, et al.
Publicado: (2024)
por: Chen, Zhuo, et al.
Publicado: (2024)
Revealing the Power of Masked Autoencoders in Traffic Forecasting
por: Sun, Jiarui, et al.
Publicado: (2023)
por: Sun, Jiarui, et al.
Publicado: (2023)
Solar PV Installation Potential Assessment on Building Facades Based on Vision and Language Foundation Models
por: Liu, Ruyu, et al.
Publicado: (2025)
por: Liu, Ruyu, et al.
Publicado: (2025)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
por: Qu, Xiaoye, et al.
Publicado: (2024)
por: Qu, Xiaoye, et al.
Publicado: (2024)
VLM-RRT: Vision Language Model Guided RRT Search for Autonomous UAV Navigation
por: Ye, Jianlin, et al.
Publicado: (2025)
por: Ye, Jianlin, et al.
Publicado: (2025)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
por: Bajpai, Divya Jyoti, et al.
Publicado: (2025)
DEFM: Delay E mbedding based Forecast Machine for Time Series Forecasting by Spatiotemporal Information Transformation
por: Peng, Hao, et al.
Publicado: (2020)
por: Peng, Hao, et al.
Publicado: (2020)
FusionSF: Fuse Heterogeneous Modalities in a Vector Quantized Framework for Robust Solar Power Forecasting
por: Ma, Ziqing, et al.
Publicado: (2024)
por: Ma, Ziqing, et al.
Publicado: (2024)
AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models
por: Xu, Shixiong, et al.
Publicado: (2025)
por: Xu, Shixiong, et al.
Publicado: (2025)
Reducing Hallucinations of Medical Multimodal Large Language Models with Visual Retrieval-Augmented Generation
por: Chu, Yun-Wei, et al.
Publicado: (2025)
por: Chu, Yun-Wei, et al.
Publicado: (2025)
Ejemplares similares
-
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
por: Liu, Hanqing, et al.
Publicado: (2026) -
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
por: Xu, Wanting, et al.
Publicado: (2024) -
HumanVLM: Foundation for Human-Scene Vision-Language Model
por: Dai, Dawei, et al.
Publicado: (2024) -
Multimodal Forecasting of Sparse Intraoperative Hypotension Events Powered by Language Model
por: Zhang, Jintao, et al.
Publicado: (2025) -
TrumorGPT: Graph-Based Retrieval-Augmented Large Language Model for Fact-Checking
por: Hang, Ching Nam, et al.
Publicado: (2025)