Autonomous Workflow for Multimodal Fine-Grained Training Assistants Towards Mixed Reality
Fuente:
arXiv
Saved in:
| Main Authors: | Pei, Jiahuan, Viola, Irene, Huang, Haochen, Wang, Junxiao, Ahsan, Moonisa, Ye, Fanghua, Yiming, Jiang, Sai, Yao, Wang, Di, Chen, Zhumin, Ren, Pengjie, Cesar, Pablo |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
by: Huang, Haochen, et al.
Published: (2025)
by: Huang, Haochen, et al.
Published: (2025)
Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
by: Pei, Jiahuan, et al.
Published: (2025)
by: Pei, Jiahuan, et al.
Published: (2025)
MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-Tuning
by: Ren, Pengjie, et al.
Published: (2024)
by: Ren, Pengjie, et al.
Published: (2024)
Trustworthy AI Psychotherapy: Multi-Agent LLM Workflow for Counseling and Explainable Mental Disorder Diagnosis
by: Ozgun, Mithat Can, et al.
Published: (2025)
by: Ozgun, Mithat Can, et al.
Published: (2025)
Beyond the Monitor: Mixed Reality Visualization and Multimodal AI for Enhanced Digital Pathology Workflow
by: Veerla, Jai Prakash, et al.
Published: (2025)
by: Veerla, Jai Prakash, et al.
Published: (2025)
MEFT: Memory-Efficient Fine-Tuning through Sparse Adapter
by: Hao, Jitai, et al.
Published: (2024)
by: Hao, Jitai, et al.
Published: (2024)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
by: Fan, Jiaxin, et al.
Published: (2026)
by: Fan, Jiaxin, et al.
Published: (2026)
UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targets
by: Wang, Wenyu, et al.
Published: (2025)
by: Wang, Wenyu, et al.
Published: (2025)
Evolution without Large Models: Training Language Model with Task Principles
by: Zhu, Minghang, et al.
Published: (2025)
by: Zhu, Minghang, et al.
Published: (2025)
KnowTuning: Knowledge-aware Fine-tuning for Large Language Models
by: Lyu, Yougang, et al.
Published: (2024)
by: Lyu, Yougang, et al.
Published: (2024)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
by: Xue, Junxiao, et al.
Published: (2026)
by: Xue, Junxiao, et al.
Published: (2026)
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
by: Sun, Qiushi, et al.
Published: (2025)
by: Sun, Qiushi, et al.
Published: (2025)
ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
by: Xu, Zhenran, et al.
Published: (2025)
by: Xu, Zhenran, et al.
Published: (2025)
MR.NAVI: Mixed-Reality Navigation Assistant for the Visually Impaired
by: Pfitzer, Nicolas, et al.
Published: (2025)
by: Pfitzer, Nicolas, et al.
Published: (2025)
Towards Fine-Grained Citation Evaluation in Generated Text: A Comparative Analysis of Faithfulness Metrics
by: Zhang, Weijia, et al.
Published: (2024)
by: Zhang, Weijia, et al.
Published: (2024)
Enhancing Multi-hop Reasoning through Knowledge Erasure in Large Language Model Editing
by: Zhang, Mengqi, et al.
Published: (2024)
by: Zhang, Mengqi, et al.
Published: (2024)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
by: Liu, Tianyi, et al.
Published: (2026)
by: Liu, Tianyi, et al.
Published: (2026)
MADS: Model-Aware Diverse Core Set Selection for Instruction Tuning
by: Bai, Yi, et al.
Published: (2026)
by: Bai, Yi, et al.
Published: (2026)
Knowledge Graph Enhanced Large Language Model Editing
by: Zhang, Mengqi, et al.
Published: (2024)
by: Zhang, Mengqi, et al.
Published: (2024)
Uncovering Overfitting in Large Language Model Editing
by: Zhang, Mengqi, et al.
Published: (2024)
by: Zhang, Mengqi, et al.
Published: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Trustworthy Medical Question Answering: An Evaluation-Centric Survey
by: Wang, Yinuo, et al.
Published: (2025)
by: Wang, Yinuo, et al.
Published: (2025)
MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants
by: Bansal, Hritik, et al.
Published: (2024)
by: Bansal, Hritik, et al.
Published: (2024)
Belief-Calibrated Multi-Agent Consensus Seeking for Complex NLP Tasks
by: Deng, Wentao, et al.
Published: (2025)
by: Deng, Wentao, et al.
Published: (2025)
Generate-then-Ground in Retrieval-Augmented Generation for Multi-hop Question Answering
by: Shi, Zhengliang, et al.
Published: (2024)
by: Shi, Zhengliang, et al.
Published: (2024)
Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems
by: Zhu, Minghang, et al.
Published: (2025)
by: Zhu, Minghang, et al.
Published: (2025)
GazePointAR: A Context-Aware Multimodal Voice Assistant for Pronoun Disambiguation in Wearable Augmented Reality
by: Lee, Jaewook, et al.
Published: (2024)
by: Lee, Jaewook, et al.
Published: (2024)
PairUni: Pairwise Training for Unified Multimodal Language Models
by: Zheng, Jiani, et al.
Published: (2025)
by: Zheng, Jiani, et al.
Published: (2025)
Uncovering Context Reliance in Unstructured Knowledge Editing
by: Zhou, Zisheng, et al.
Published: (2026)
by: Zhou, Zisheng, et al.
Published: (2026)
ASLoRA: Adaptive Sharing Low-Rank Adaptation Across Layers
by: Hu, Junyan, et al.
Published: (2024)
by: Hu, Junyan, et al.
Published: (2024)
Disentangling Knowledge Representations for Large Language Model Editing
by: Zhang, Mengqi, et al.
Published: (2025)
by: Zhang, Mengqi, et al.
Published: (2025)
ANDHRA Bandersnatch: Training Neural Networks to Predict Parallel Realities
by: Daliparthi, Venkata Satya Sai Ajay
Published: (2024)
by: Daliparthi, Venkata Satya Sai Ajay
Published: (2024)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
by: Kuchibhotla, Hari Chandana, et al.
Published: (2025)
by: Kuchibhotla, Hari Chandana, et al.
Published: (2025)
ASPO: Adaptive Sentence-Level Preference Optimization for Fine-Grained Multimodal Reasoning
by: Wang, Yeyuan, et al.
Published: (2025)
by: Wang, Yeyuan, et al.
Published: (2025)
Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agents
by: Sun, Weiwei, et al.
Published: (2023)
by: Sun, Weiwei, et al.
Published: (2023)
ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality
by: Khan, Dawar, et al.
Published: (2026)
by: Khan, Dawar, et al.
Published: (2026)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
by: Li, Yongqi, et al.
Published: (2025)
by: Li, Yongqi, et al.
Published: (2025)
AMELI: Enhancing Multimodal Entity Linking with Fine-Grained Attributes
by: Yao, Barry Menglong, et al.
Published: (2023)
by: Yao, Barry Menglong, et al.
Published: (2023)
LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control
by: Jeong, Seogyeong, et al.
Published: (2026)
by: Jeong, Seogyeong, et al.
Published: (2026)
AcuVR: Enhancing Acupuncture Training Workflow with Virtual Reality
by: Zhang, Menghe, et al.
Published: (2024)
by: Zhang, Menghe, et al.
Published: (2024)
Similar Items
-
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
by: Huang, Haochen, et al.
Published: (2025) -
Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
by: Pei, Jiahuan, et al.
Published: (2025) -
MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-Tuning
by: Ren, Pengjie, et al.
Published: (2024) -
Trustworthy AI Psychotherapy: Multi-Agent LLM Workflow for Counseling and Explainable Mental Disorder Diagnosis
by: Ozgun, Mithat Can, et al.
Published: (2025) -
Beyond the Monitor: Mixed Reality Visualization and Multimodal AI for Enhanced Digital Pathology Workflow
by: Veerla, Jai Prakash, et al.
Published: (2025)