Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era
Fuente:
arXiv
Saved in:
| Main Authors: | Nguyen, Thanh Tam, Ren, Zhao, Pham, Trinh, Huynh, Thanh Trung, Nguyen, Phi Le, Yin, Hongzhi, Nguyen, Quoc Viet Hung |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers
by: Hoang, Thanh Dat, et al.
Published: (2025)
by: Hoang, Thanh Dat, et al.
Published: (2025)
Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data
by: Phung, Thu Hang, et al.
Published: (2026)
by: Phung, Thu Hang, et al.
Published: (2026)
A Survey of Privacy-Preserving Model Explanations: Privacy Risks, Attacks, and Countermeasures
by: Nguyen, Thanh Tam, et al.
Published: (2024)
by: Nguyen, Thanh Tam, et al.
Published: (2024)
FINER-SQL: Boosting Small Language Models for Text-to-SQL
by: Hoang, Thanh Dat, et al.
Published: (2026)
by: Hoang, Thanh Dat, et al.
Published: (2026)
A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback
by: Hoang, Thanh Dat, et al.
Published: (2025)
by: Hoang, Thanh Dat, et al.
Published: (2025)
AV-SQL: Decomposing Complex Text-to-SQL Queries with Agentic Views
by: Pham, Minh Tam, et al.
Published: (2026)
by: Pham, Minh Tam, et al.
Published: (2026)
An Efficient and Effective Evaluator for Text2SQL Models on Unseen and Unlabeled Data
by: Pham, Trinh, et al.
Published: (2026)
by: Pham, Trinh, et al.
Published: (2026)
Cost-Effective Model Evaluation with Meta-Learning
by: Pham, Trinh, et al.
Published: (2026)
by: Pham, Trinh, et al.
Published: (2026)
SimInterview: Transforming Business Education through Large Language Model-Based Simulated Multilingual Interview Training System
by: Nguyen, Truong Thanh Hung, et al.
Published: (2025)
by: Nguyen, Truong Thanh Hung, et al.
Published: (2025)
FedMAC: Tackling Partial-Modality Missing in Federated Learning with Cross-Modal Aggregation and Contrastive Regularization
by: Nguyen, Manh Duong, et al.
Published: (2024)
by: Nguyen, Manh Duong, et al.
Published: (2024)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
by: Nguyen, Hieu Minh, et al.
Published: (2025)
by: Nguyen, Hieu Minh, et al.
Published: (2025)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
by: Nguyen, Truong Thanh Hung, et al.
Published: (2026)
by: Nguyen, Truong Thanh Hung, et al.
Published: (2026)
A Survey of Machine Unlearning
by: Nguyen, Thanh Tam, et al.
Published: (2022)
by: Nguyen, Thanh Tam, et al.
Published: (2022)
Heterogeneous Hypergraph Embedding for Recommendation Systems
by: Sakong, Darnbi, et al.
Published: (2024)
by: Sakong, Darnbi, et al.
Published: (2024)
Fast-FedUL: A Training-Free Federated Unlearning with Provable Skew Resilience
by: Huynh, Thanh Trung, et al.
Published: (2024)
by: Huynh, Thanh Trung, et al.
Published: (2024)
Manipulating Recommender Systems: A Survey of Poisoning Attacks and Countermeasures
by: Nguyen, Thanh Toan, et al.
Published: (2024)
by: Nguyen, Thanh Toan, et al.
Published: (2024)
Real-time 3D Light-field Viewing with Eye-tracking on Conventional Displays
by: Pham, Trung Hieu, et al.
Published: (2025)
by: Pham, Trung Hieu, et al.
Published: (2025)
One Size Doesn't Fit All: Age-Aware Gamification Mechanics for Multimedia Learning Environments
by: Kaißer, Sarah, et al.
Published: (2025)
by: Kaißer, Sarah, et al.
Published: (2025)
Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation
by: Nguyen, Loc Phuc Truong, et al.
Published: (2025)
by: Nguyen, Loc Phuc Truong, et al.
Published: (2025)
InfoCIR: Multimedia Analysis for Composed Image Retrieval
by: Dravilas, Ioannis, et al.
Published: (2026)
by: Dravilas, Ioannis, et al.
Published: (2026)
A Multimedia Analytics Model for the Foundation Model Era
by: Worring, Marcel, et al.
Published: (2025)
by: Worring, Marcel, et al.
Published: (2025)
Evaluating the Usability of Microgestures for Text Editing Tasks in Virtual Reality
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
Cooperate to Compete: Strategic Data Generation and Incentivization Framework for Coopetitive Cross-Silo Federated Learning
by: Nguyen, Thanh Linh, et al.
Published: (2026)
by: Nguyen, Thanh Linh, et al.
Published: (2026)
Agentic Mixed-Source Multi-Modal Misinformation Detection with Adaptive Test-Time Scaling
by: Jiang, Wei, et al.
Published: (2026)
by: Jiang, Wei, et al.
Published: (2026)
ICE: Interactive 3D Game Character Editing via Dialogue
by: Wu, Haoqian, et al.
Published: (2024)
by: Wu, Haoqian, et al.
Published: (2024)
CT to PET Translation: A Large-scale Dataset and Domain-Knowledge-Guided Diffusion Approach
by: Nguyen, Dac Thai, et al.
Published: (2024)
by: Nguyen, Dac Thai, et al.
Published: (2024)
A Rhetorical Relations-Based Framework for Tailored Multimedia Document Summarization
by: Maredj, Azze-Eddine, et al.
Published: (2024)
by: Maredj, Azze-Eddine, et al.
Published: (2024)
LAVE: LLM-Powered Agent Assistance and Language Augmentation for Video Editing
by: Wang, Bryan, et al.
Published: (2024)
by: Wang, Bryan, et al.
Published: (2024)
Multilingual Text-to-SQL: Benchmarking the Limits of Language Models with Collaborative Language Agents
by: Pham, Khanh Trinh, et al.
Published: (2025)
by: Pham, Khanh Trinh, et al.
Published: (2025)
Photoshop Batch Rendering Using Actions for Stylistic Video Editing
by: De La Fuente, Tessa
Published: (2025)
by: De La Fuente, Tessa
Published: (2025)
User-Generated Content and Editors in Games: A Comprehensive Survey
by: Liu, Yuyue, et al.
Published: (2024)
by: Liu, Yuyue, et al.
Published: (2024)
Language-Guided Multimodal Texture Authoring via Generative Models
by: Qian, Wanli, et al.
Published: (2026)
by: Qian, Wanli, et al.
Published: (2026)
Self-Guided Virtual Reality Therapy for Anxiety: A Systematic Review
by: Graham, Winona, et al.
Published: (2025)
by: Graham, Winona, et al.
Published: (2025)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
by: Nguyen, Ngoc-Son, et al.
Published: (2026)
by: Nguyen, Ngoc-Son, et al.
Published: (2026)
IllusionX: An LLM-powered mixed reality personal companion
by: Yousri, Ramez, et al.
Published: (2024)
by: Yousri, Ramez, et al.
Published: (2024)
Human-Machine Collaboration-Guided Space Design: Combination of Machine Learning Models and Humanistic Design Concepts
by: Yang, Yuxuan
Published: (2025)
by: Yang, Yuxuan
Published: (2025)
Save It for the "Hot" Day: An LLM-Empowered Visual Analytics System for Heat Risk Management
by: Li, Haobo, et al.
Published: (2024)
by: Li, Haobo, et al.
Published: (2024)
Talking-to-Build: How LLM-Assisted Interface Shapes Player Performance and Experience in Minecraft
by: Sun, Xin, et al.
Published: (2025)
by: Sun, Xin, et al.
Published: (2025)
Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective
by: Wan, Ninghao, et al.
Published: (2026)
by: Wan, Ninghao, et al.
Published: (2026)
A Coopetitive-Compatible Data Generation Framework for Cross-silo Federated Learning
by: Nguyen, Thanh Linh, et al.
Published: (2025)
by: Nguyen, Thanh Linh, et al.
Published: (2025)
Similar Items
-
Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers
by: Hoang, Thanh Dat, et al.
Published: (2025) -
Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data
by: Phung, Thu Hang, et al.
Published: (2026) -
A Survey of Privacy-Preserving Model Explanations: Privacy Risks, Attacks, and Countermeasures
by: Nguyen, Thanh Tam, et al.
Published: (2024) -
FINER-SQL: Boosting Small Language Models for Text-to-SQL
by: Hoang, Thanh Dat, et al.
Published: (2026) -
A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback
by: Hoang, Thanh Dat, et al.
Published: (2025)