CI w/o TN: Context Injection without Task Name for Procedure Planning
Fuente:
arXiv
Salvato in:
| Autore principale: | Li, Xinjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
di: Miao, Ziqi, et al.
Pubblicazione: (2025)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
di: Li, Jinyuan, et al.
Pubblicazione: (2024)
di: Li, Jinyuan, et al.
Pubblicazione: (2024)
RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge Injection
di: Hou, Wenjun, et al.
Pubblicazione: (2025)
di: Hou, Wenjun, et al.
Pubblicazione: (2025)
Multimedia Generative Script Learning for Task Planning
di: Wang, Qingyun, et al.
Pubblicazione: (2022)
di: Wang, Qingyun, et al.
Pubblicazione: (2022)
Hands-off Image Editing: Language-guided Editing without any Task-specific Labeling, Masking or even Training
di: Santos, Rodrigo, et al.
Pubblicazione: (2025)
di: Santos, Rodrigo, et al.
Pubblicazione: (2025)
Predicting Implicit Arguments in Procedural Video Instructions
di: Batra, Anil, et al.
Pubblicazione: (2025)
di: Batra, Anil, et al.
Pubblicazione: (2025)
Text Prompt Injection of Vision Language Models
di: Zhu, Ruizhe
Pubblicazione: (2025)
di: Zhu, Ruizhe
Pubblicazione: (2025)
Enhancing Chest X-ray Classification through Knowledge Injection in Cross-Modality Learning
di: Yan, Yang, et al.
Pubblicazione: (2025)
di: Yan, Yang, et al.
Pubblicazione: (2025)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
di: Li, Yanshu
Pubblicazione: (2025)
di: Li, Yanshu
Pubblicazione: (2025)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
di: Wang, Yanan, et al.
Pubblicazione: (2025)
di: Wang, Yanan, et al.
Pubblicazione: (2025)
Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation
di: Li, Jinyuan, et al.
Pubblicazione: (2024)
di: Li, Jinyuan, et al.
Pubblicazione: (2024)
E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition
di: Zhang, Meng, et al.
Pubblicazione: (2026)
di: Zhang, Meng, et al.
Pubblicazione: (2026)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
GPT-4V(ision) for Robotics: Multimodal Task Planning from Human Demonstration
di: Wake, Naoki, et al.
Pubblicazione: (2023)
di: Wake, Naoki, et al.
Pubblicazione: (2023)
Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
di: Cheng, Hao, et al.
Pubblicazione: (2025)
di: Cheng, Hao, et al.
Pubblicazione: (2025)
MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models
di: Belouadi, Jonas, et al.
Pubblicazione: (2025)
di: Belouadi, Jonas, et al.
Pubblicazione: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos
di: Niu, Yulei, et al.
Pubblicazione: (2024)
di: Niu, Yulei, et al.
Pubblicazione: (2024)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2023)
di: Ohkawa, Takehiko, et al.
Pubblicazione: (2023)
Mobile-Agent-V: A Video-Guided Approach for Effortless and Efficient Operational Knowledge Injection in Mobile Automation
di: Wang, Junyang, et al.
Pubblicazione: (2025)
di: Wang, Junyang, et al.
Pubblicazione: (2025)
From Text to Pixel: Advancing Long-Context Understanding in MLLMs
di: Lu, Yujie, et al.
Pubblicazione: (2024)
di: Lu, Yujie, et al.
Pubblicazione: (2024)
Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors
di: Luo, Fuwen, et al.
Pubblicazione: (2026)
di: Luo, Fuwen, et al.
Pubblicazione: (2026)
Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
di: Chen, Dongping, et al.
Pubblicazione: (2026)
di: Chen, Dongping, et al.
Pubblicazione: (2026)
VERA: Identifying and Leveraging Visual Evidence Retrieval Heads in Long-Context Understanding
di: Pei, Rongcan, et al.
Pubblicazione: (2026)
di: Pei, Rongcan, et al.
Pubblicazione: (2026)
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
di: Xu, Run, et al.
Pubblicazione: (2026)
di: Xu, Run, et al.
Pubblicazione: (2026)
Task-Aware Resolution Optimization for Visual Large Language Models
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
di: Wu, Hao, et al.
Pubblicazione: (2026)
di: Wu, Hao, et al.
Pubblicazione: (2026)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
di: Li, Bo, et al.
Pubblicazione: (2023)
di: Li, Bo, et al.
Pubblicazione: (2023)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
di: Merlo, Filippo, et al.
Pubblicazione: (2025)
di: Merlo, Filippo, et al.
Pubblicazione: (2025)
Support or Refute: Analyzing the Stance of Evidence to Detect Out-of-Context Mis- and Disinformation
di: Yuan, Xin, et al.
Pubblicazione: (2023)
di: Yuan, Xin, et al.
Pubblicazione: (2023)
OMCAT: Omni Context Aware Transformer
di: Goel, Arushi, et al.
Pubblicazione: (2024)
di: Goel, Arushi, et al.
Pubblicazione: (2024)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Low-Rank Adaptation with Task-Relevant Feature Enhancement for Fine-tuning Language Models
di: Li, Changqun, et al.
Pubblicazione: (2024)
di: Li, Changqun, et al.
Pubblicazione: (2024)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
di: Miao, Ziqi, et al.
Pubblicazione: (2025) -
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
di: Li, Jinyuan, et al.
Pubblicazione: (2024) -
RADAR: Enhancing Radiology Report Generation with Supplementary Knowledge Injection
di: Hou, Wenjun, et al.
Pubblicazione: (2025) -
Multimedia Generative Script Learning for Task Planning
di: Wang, Qingyun, et al.
Pubblicazione: (2022) -
Hands-off Image Editing: Language-guided Editing without any Task-specific Labeling, Masking or even Training
di: Santos, Rodrigo, et al.
Pubblicazione: (2025)