Reinforcement Learning Friendly Vision-Language Model for Minecraft
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Haobin, Yue, Junpeng, Luo, Hao, Ding, Ziluo, Lu, Zongqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SELU: Self-Learning Embodied MLLMs in Unknown Environments
di: Li, Boyu, et al.
Pubblicazione: (2024)
di: Li, Boyu, et al.
Pubblicazione: (2024)
Visual Grounding for Object-Level Generalization in Reinforcement Learning
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
Egocentric Vision Language Planning
di: Fang, Zhirui, et al.
Pubblicazione: (2024)
di: Fang, Zhirui, et al.
Pubblicazione: (2024)
Pre-trained Visual Dynamics Representations for Efficient Policy Learning
di: Luo, Hao, et al.
Pubblicazione: (2024)
di: Luo, Hao, et al.
Pubblicazione: (2024)
Settling Decentralized Multi-Agent Coordinated Exploration by Novelty Sharing
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model
di: Cao, Bin, et al.
Pubblicazione: (2025)
di: Cao, Bin, et al.
Pubblicazione: (2025)
VideoOrion: Tokenizing Object Dynamics in Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2024)
di: Feng, Yicheng, et al.
Pubblicazione: (2024)
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
di: Luo, Hao, et al.
Pubblicazione: (2025)
di: Luo, Hao, et al.
Pubblicazione: (2025)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
di: Ding, Yuhe, et al.
Pubblicazione: (2024)
di: Ding, Yuhe, et al.
Pubblicazione: (2024)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
Improving Vision-Language-Action Model with Online Reinforcement Learning
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
di: Guo, Yanjiang, et al.
Pubblicazione: (2025)
BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
di: Zhao, Yunhan, et al.
Pubblicazione: (2024)
Contrastive Language-Colored Pointmap Pretraining for Unified 3D Scene Understanding
di: Mao, Ye, et al.
Pubblicazione: (2026)
di: Mao, Ye, et al.
Pubblicazione: (2026)
Vision-Language Models are Strong Noisy Label Detectors
di: Wei, Tong, et al.
Pubblicazione: (2024)
di: Wei, Tong, et al.
Pubblicazione: (2024)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
BECAME: BayEsian Continual Learning with Adaptive Model MErging
di: Li, Mei, et al.
Pubblicazione: (2025)
di: Li, Mei, et al.
Pubblicazione: (2025)
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
di: Shen, Junhao, et al.
Pubblicazione: (2025)
di: Shen, Junhao, et al.
Pubblicazione: (2025)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
di: Ding, Yi, et al.
Pubblicazione: (2026)
di: Ding, Yi, et al.
Pubblicazione: (2026)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
di: Chen, William, et al.
Pubblicazione: (2024)
di: Chen, William, et al.
Pubblicazione: (2024)
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
di: Li, Yujun, et al.
Pubblicazione: (2026)
di: Li, Yujun, et al.
Pubblicazione: (2026)
Scaling Large Motion Models with Million-Level Human Motions
di: Wang, Ye, et al.
Pubblicazione: (2024)
di: Wang, Ye, et al.
Pubblicazione: (2024)
Learning without Forgetting for Vision-Language Models
di: Zhou, Da-Wei, et al.
Pubblicazione: (2023)
di: Zhou, Da-Wei, et al.
Pubblicazione: (2023)
Tree of Attributes Prompt Learning for Vision-Language Models
di: Ding, Tong, et al.
Pubblicazione: (2024)
di: Ding, Tong, et al.
Pubblicazione: (2024)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
di: Luo, Jun, et al.
Pubblicazione: (2024)
di: Luo, Jun, et al.
Pubblicazione: (2024)
A Survey on Deep Clustering: From the Prior Perspective
di: Lu, Yiding, et al.
Pubblicazione: (2024)
di: Lu, Yiding, et al.
Pubblicazione: (2024)
Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models
di: Yoon, Lauren Hyoseo, et al.
Pubblicazione: (2025)
di: Yoon, Lauren Hyoseo, et al.
Pubblicazione: (2025)
Lightweight Unsupervised Federated Learning with Pretrained Vision Language Model
di: Yan, Hao, et al.
Pubblicazione: (2024)
di: Yan, Hao, et al.
Pubblicazione: (2024)
Transitive Vision-Language Prompt Learning for Domain Generalization
di: Wang, Liyuan, et al.
Pubblicazione: (2024)
di: Wang, Liyuan, et al.
Pubblicazione: (2024)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
di: Yang, Senqiao, et al.
Pubblicazione: (2025)
CAPT: Class-Aware Prompt Tuning for Federated Long-Tailed Learning with Vision-Language Model
di: Hou, Shihao, et al.
Pubblicazione: (2025)
di: Hou, Shihao, et al.
Pubblicazione: (2025)
MMRL: Multi-Modal Representation Learning for Vision-Language Models
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
NLPrompt: Noise-Label Prompt Learning for Vision-Language Models
di: Pan, Bikang, et al.
Pubblicazione: (2024)
di: Pan, Bikang, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Vision-Language Models through Image-Guided Head Suppression
di: Sarkar, Sreetama, et al.
Pubblicazione: (2025)
di: Sarkar, Sreetama, et al.
Pubblicazione: (2025)
Minecraft-ify: Minecraft Style Image Generation with Text-guided Image Editing for In-Game Application
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
di: Kim, Bumsoo, et al.
Pubblicazione: (2024)
Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure
di: Chakraborty, Trishna, et al.
Pubblicazione: (2026)
di: Chakraborty, Trishna, et al.
Pubblicazione: (2026)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)
di: Hao, Tianxiang, et al.
Pubblicazione: (2023)
Fine-tuned Vision Language Model for Localization of Parasitic Eggs in Microscopic Images
di: Sien, Chan Hao, et al.
Pubblicazione: (2026)
di: Sien, Chan Hao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
SELU: Self-Learning Embodied MLLMs in Unknown Environments
di: Li, Boyu, et al.
Pubblicazione: (2024) -
Visual Grounding for Object-Level Generalization in Reinforcement Learning
di: Jiang, Haobin, et al.
Pubblicazione: (2024) -
Egocentric Vision Language Planning
di: Fang, Zhirui, et al.
Pubblicazione: (2024) -
Pre-trained Visual Dynamics Representations for Efficient Policy Learning
di: Luo, Hao, et al.
Pubblicazione: (2024) -
Settling Decentralized Multi-Agent Coordinated Exploration by Novelty Sharing
di: Jiang, Haobin, et al.
Pubblicazione: (2024)