RoboOmni: Proactive Robot Manipulation in Omni-modal Context
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Siyin, Fu, Jinlan, Liu, Feihong, He, Xinzhe, Wu, Huangxuan, Shi, Junhao, Huang, Kexin, Fei, Zhaoye, Gong, Jingjing, Wu, Zuxuan, Jiang, Yu-Gang, Ng, See-Kiong, Chua, Tat-Seng, Qiu, Xipeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
von: Chen, Qian, et al.
Veröffentlicht: (2026)
von: Chen, Qian, et al.
Veröffentlicht: (2026)
Ask-before-Plan: Proactive Language Agents for Real-World Planning
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
von: Zhang, Xuan, et al.
Veröffentlicht: (2024)
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
von: Zhao, Yong, et al.
Veröffentlicht: (2025)
von: Zhao, Yong, et al.
Veröffentlicht: (2025)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
von: Fu, Jinlan, et al.
Veröffentlicht: (2025)
von: Fu, Jinlan, et al.
Veröffentlicht: (2025)
Principled Multimodal Representation Learning
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
von: Zhang, Haowei, et al.
Veröffentlicht: (2026)
von: Zhang, Haowei, et al.
Veröffentlicht: (2026)
Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning
von: Fei, Zhaoye, et al.
Veröffentlicht: (2025)
von: Fei, Zhaoye, et al.
Veröffentlicht: (2025)
Hint-before-Solving Prompting: Guiding LLMs to Effectively Utilize Encoded Knowledge
von: Fu, Jinlan, et al.
Veröffentlicht: (2024)
von: Fu, Jinlan, et al.
Veröffentlicht: (2024)
World Action Models: The Next Frontier in Embodied AI
von: Wang, Siyin, et al.
Veröffentlicht: (2026)
von: Wang, Siyin, et al.
Veröffentlicht: (2026)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
von: Deng, Yang, et al.
Veröffentlicht: (2024)
von: Deng, Yang, et al.
Veröffentlicht: (2024)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
von: Deng, Yang, et al.
Veröffentlicht: (2023)
von: Deng, Yang, et al.
Veröffentlicht: (2023)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
Towards Modality Generalization: A Benchmark and Prospective Analysis
von: Liu, Xiaohao, et al.
Veröffentlicht: (2024)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2024)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
von: Fei, Senyu, et al.
Veröffentlicht: (2025)
von: Fei, Senyu, et al.
Veröffentlicht: (2025)
On the Multi-turn Instruction Following for Conversational Web Agents
von: Deng, Yang, et al.
Veröffentlicht: (2024)
von: Deng, Yang, et al.
Veröffentlicht: (2024)
CET2: Modelling Topic Transitions for Coherent and Engaging Knowledge-Grounded Conversations
von: Xu, Lin, et al.
Veröffentlicht: (2024)
von: Xu, Lin, et al.
Veröffentlicht: (2024)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
von: Fu, Jinlan, et al.
Veröffentlicht: (2025)
von: Fu, Jinlan, et al.
Veröffentlicht: (2025)
FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models
von: Lin, Hongzhan, et al.
Veröffentlicht: (2025)
von: Lin, Hongzhan, et al.
Veröffentlicht: (2025)
ThinkTank-ME: A Multi-Expert Framework for Middle East Event Forecasting
von: Li, Haoxuan, et al.
Veröffentlicht: (2026)
von: Li, Haoxuan, et al.
Veröffentlicht: (2026)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
von: Zhou, Ziwei, et al.
Veröffentlicht: (2025)
von: Zhou, Ziwei, et al.
Veröffentlicht: (2025)
Exploring the Impact of Personality Traits on Conversational Recommender Systems: A Simulation with Large Language Models
von: Zhao, Xiaoyan, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaoyan, et al.
Veröffentlicht: (2025)
NExT-Search: Rebuilding User Feedback Ecosystem for Generative AI Search
von: Dai, Sunhao, et al.
Veröffentlicht: (2025)
von: Dai, Sunhao, et al.
Veröffentlicht: (2025)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
von: Li, Haoxuan, et al.
Veröffentlicht: (2025)
von: Li, Haoxuan, et al.
Veröffentlicht: (2025)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
Chain of Thought Explanation for Dialogue State Tracking
von: Xu, Lin, et al.
Veröffentlicht: (2024)
von: Xu, Lin, et al.
Veröffentlicht: (2024)
Calibrated Multimodal Representation Learning with Missing Modalities
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
Knowledge Boundary of Large Language Models: A Survey
von: Li, Moxin, et al.
Veröffentlicht: (2024)
von: Li, Moxin, et al.
Veröffentlicht: (2024)
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
von: Ding, Yue, et al.
Veröffentlicht: (2026)
von: Ding, Yue, et al.
Veröffentlicht: (2026)
Efficient Inference for Large Language Model-based Generative Recommendation
von: Lin, Xinyu, et al.
Veröffentlicht: (2024)
von: Lin, Xinyu, et al.
Veröffentlicht: (2024)
Continual Multimodal Contrastive Learning
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
von: Tong, Wenwen, et al.
Veröffentlicht: (2025)
von: Tong, Wenwen, et al.
Veröffentlicht: (2025)
OmniTracker: Unifying Object Tracking by Tracking-with-Detection
von: Wang, Junke, et al.
Veröffentlicht: (2023)
von: Wang, Junke, et al.
Veröffentlicht: (2023)
Towards Human-centered Proactive Conversational Agents
von: Deng, Yang, et al.
Veröffentlicht: (2024)
von: Deng, Yang, et al.
Veröffentlicht: (2024)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
von: Wang, Siyin, et al.
Veröffentlicht: (2024)
von: Wang, Siyin, et al.
Veröffentlicht: (2024)
Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
von: He, Chaoqun, et al.
Veröffentlicht: (2026)
von: He, Chaoqun, et al.
Veröffentlicht: (2026)
OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation
von: Wang, Junke, et al.
Veröffentlicht: (2024)
von: Wang, Junke, et al.
Veröffentlicht: (2024)
OmniVid: A Generative Framework for Universal Video Understanding
von: Wang, Junke, et al.
Veröffentlicht: (2024)
von: Wang, Junke, et al.
Veröffentlicht: (2024)
L-MTP: Leap Multi-Token Prediction Beyond Adjacent Context for Large Language Models
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
Towards Proactive Information Probing: Customer Service Chatbots Harvesting Value from Conversation
von: Huang, Chen, et al.
Veröffentlicht: (2026)
von: Huang, Chen, et al.
Veröffentlicht: (2026)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
von: Guan, Yiran, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
von: Chen, Qian, et al.
Veröffentlicht: (2026) -
Ask-before-Plan: Proactive Language Agents for Real-World Planning
von: Zhang, Xuan, et al.
Veröffentlicht: (2024) -
Aligning Large Language Models for Faithful Integrity Against Opposing Argument
von: Zhao, Yong, et al.
Veröffentlicht: (2025) -
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
von: Fu, Jinlan, et al.
Veröffentlicht: (2025) -
Principled Multimodal Representation Learning
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)