LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Shibo, Li, Xue, Di, Donglin, Wei, Mingjie, Nie, Lanshun, Zhang, Wei-Nan, Zhan, Dechen, Song, Yang, Fan, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SAGE: A Visual Language Model for Anomaly Detection via Fact Enhancement and Entropy-aware Alignment
di: Zang, Guoxin, et al.
Pubblicazione: (2025)
di: Zang, Guoxin, et al.
Pubblicazione: (2025)
S2C‐HAR: A Semi‐Supervised Human Activity Recognition Framework Based on Contrastive Learning
di: Xue Li, et al.
Pubblicazione: (2025)
di: Xue Li, et al.
Pubblicazione: (2025)
MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning
di: Ye, Juexiang, et al.
Pubblicazione: (2026)
di: Ye, Juexiang, et al.
Pubblicazione: (2026)
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
di: Shi, Lei, et al.
Pubblicazione: (2025)
di: Shi, Lei, et al.
Pubblicazione: (2025)
LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos
di: Shi, Lei, et al.
Pubblicazione: (2026)
di: Shi, Lei, et al.
Pubblicazione: (2026)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
di: Sun, Yirong, et al.
Pubblicazione: (2025)
di: Sun, Yirong, et al.
Pubblicazione: (2025)
PaT: Planning-after-Trial for Efficient Test-Time Code Generation
di: Yoon, Youngsik, et al.
Pubblicazione: (2026)
di: Yoon, Youngsik, et al.
Pubblicazione: (2026)
Salvaging the Overlooked: Leveraging Class-Aware Contrastive Learning for Multi-Class Anomaly Detection
di: Fan, Lei, et al.
Pubblicazione: (2024)
di: Fan, Lei, et al.
Pubblicazione: (2024)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
di: Sun, Hao, et al.
Pubblicazione: (2025)
di: Sun, Hao, et al.
Pubblicazione: (2025)
CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning
di: Feng, He, et al.
Pubblicazione: (2026)
di: Feng, He, et al.
Pubblicazione: (2026)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
di: Xu, Guowei, et al.
Pubblicazione: (2024)
di: Xu, Guowei, et al.
Pubblicazione: (2024)
ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities
di: Su, Ying, et al.
Pubblicazione: (2024)
di: Su, Ying, et al.
Pubblicazione: (2024)
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
di: Brahman, Faeze, et al.
Pubblicazione: (2023)
di: Brahman, Faeze, et al.
Pubblicazione: (2023)
Hypergraph Tversky-Aware Domain Incremental Learning for Brain Tumor Segmentation with Missing Modalities
di: Wang, Junze, et al.
Pubblicazione: (2025)
di: Wang, Junze, et al.
Pubblicazione: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
di: Wen, Yuqing, et al.
Pubblicazione: (2025)
di: Wen, Yuqing, et al.
Pubblicazione: (2025)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2023)
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2023)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
di: Sun, Jintao, et al.
Pubblicazione: (2026)
di: Sun, Jintao, et al.
Pubblicazione: (2026)
VLA^2: Empowering Vision-Language-Action Models with an Agentic Framework for Unseen Concept Manipulation
di: Zhao, Han, et al.
Pubblicazione: (2025)
di: Zhao, Han, et al.
Pubblicazione: (2025)
LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning
di: Liu, Yudong, et al.
Pubblicazione: (2025)
di: Liu, Yudong, et al.
Pubblicazione: (2025)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
di: Zhan, Xuhui, et al.
Pubblicazione: (2025)
di: Zhan, Xuhui, et al.
Pubblicazione: (2025)
Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework
di: Statkiewicz, Grzegorz, et al.
Pubblicazione: (2026)
di: Statkiewicz, Grzegorz, et al.
Pubblicazione: (2026)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models
di: Zhao, Hengyuan, et al.
Pubblicazione: (2025)
di: Zhao, Hengyuan, et al.
Pubblicazione: (2025)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
di: Shin, Dongjae, et al.
Pubblicazione: (2024)
di: Shin, Dongjae, et al.
Pubblicazione: (2024)
AutoPrep: Natural Language Question-Aware Data Preparation with a Multi-Agent Framework
di: Fan, Meihao, et al.
Pubblicazione: (2024)
di: Fan, Meihao, et al.
Pubblicazione: (2024)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
di: Chu, Xiangxiang, et al.
Pubblicazione: (2024)
di: Chu, Xiangxiang, et al.
Pubblicazione: (2024)
Exploring the Roles of Large Language Models in Reshaping Transportation Systems: A Survey, Framework, and Roadmap
di: Nie, Tong, et al.
Pubblicazione: (2025)
di: Nie, Tong, et al.
Pubblicazione: (2025)
Global-Local Aware Scene Text Editing
di: Yang, Fuxiang, et al.
Pubblicazione: (2025)
di: Yang, Fuxiang, et al.
Pubblicazione: (2025)
Vision-Language Model Predictive Control for Manipulation Planning and Trajectory Generation
di: Chen, Jiaming, et al.
Pubblicazione: (2025)
di: Chen, Jiaming, et al.
Pubblicazione: (2025)
EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models
di: Wang, Kun, et al.
Pubblicazione: (2025)
di: Wang, Kun, et al.
Pubblicazione: (2025)
MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation
di: Liu, Huaize, et al.
Pubblicazione: (2025)
di: Liu, Huaize, et al.
Pubblicazione: (2025)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model
di: Liu, Zhou, et al.
Pubblicazione: (2026)
di: Liu, Zhou, et al.
Pubblicazione: (2026)
LLaSE-G1: Incentivizing Generalization Capability for LLaMA-based Speech Enhancement
di: Kang, Boyi, et al.
Pubblicazione: (2025)
di: Kang, Boyi, et al.
Pubblicazione: (2025)
GRPose: Learning Graph Relations for Human Image Generation with Pose Priors
di: Yin, Xiangchen, et al.
Pubblicazione: (2024)
di: Yin, Xiangchen, et al.
Pubblicazione: (2024)
When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs
di: Fang, Yu, et al.
Pubblicazione: (2026)
di: Fang, Yu, et al.
Pubblicazione: (2026)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation
di: Feng, He, et al.
Pubblicazione: (2025)
di: Feng, He, et al.
Pubblicazione: (2025)
Yo'LLaVA: Your Personalized Language and Vision Assistant
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
di: Nguyen, Thao, et al.
Pubblicazione: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
An Identifiable Cost-Aware Causal Decision-Making Framework Using Counterfactual Reasoning
di: Cai, Ruichu, et al.
Pubblicazione: (2025)
di: Cai, Ruichu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SAGE: A Visual Language Model for Anomaly Detection via Fact Enhancement and Entropy-aware Alignment
di: Zang, Guoxin, et al.
Pubblicazione: (2025) -
S2C‐HAR: A Semi‐Supervised Human Activity Recognition Framework Based on Contrastive Learning
di: Xue Li, et al.
Pubblicazione: (2025) -
MemWeaver: Weaving Hybrid Memories for Traceable Long-Horizon Agentic Reasoning
di: Ye, Juexiang, et al.
Pubblicazione: (2026) -
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
di: Shi, Lei, et al.
Pubblicazione: (2025) -
LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos
di: Shi, Lei, et al.
Pubblicazione: (2026)