Enregistré dans:
| Auteurs principaux: | Chen, Shuai, Chen, Hao, Bei, Yuanchen, Zhao, Tianyang, Zhou, Zhibo, Huang, Feiran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.08876 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Embody4D: A Generalist 4D World Model for Embodied AI
par: Tu, Peiyan, et autres
Publié: (2026)
par: Tu, Peiyan, et autres
Publié: (2026)
SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space
par: Kang, Zejian, et autres
Publié: (2026)
par: Kang, Zejian, et autres
Publié: (2026)
Multimodal Data Storage and Retrieval for Embodied AI: A Survey
par: Lu, Yihao, et autres
Publié: (2025)
par: Lu, Yihao, et autres
Publié: (2025)
Improving Human Image Animation via Semantic Representation Alignment
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes
par: Wu, Jingchao, et autres
Publié: (2025)
par: Wu, Jingchao, et autres
Publié: (2025)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
par: X, Tencent Robotics, et autres
Publié: (2026)
par: X, Tencent Robotics, et autres
Publié: (2026)
Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning
par: Gao, Minghe, et autres
Publié: (2025)
par: Gao, Minghe, et autres
Publié: (2025)
Bidirectional Channel-selective Semantic Interaction for Semi-Supervised Medical Segmentation
par: Huang, Kaiwen, et autres
Publié: (2026)
par: Huang, Kaiwen, et autres
Publié: (2026)
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
par: Zhong, Fangwei, et autres
Publié: (2024)
par: Zhong, Fangwei, et autres
Publié: (2024)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
par: Zhao, Yaqi, et autres
Publié: (2026)
par: Zhao, Yaqi, et autres
Publié: (2026)
Unified Multi-Foundation-Model Slide Representation for Pan-Cancer Recognition and Text-Guided Tumor Localization
par: Wang, Tianyang, et autres
Publié: (2026)
par: Wang, Tianyang, et autres
Publié: (2026)
Decoupling Semantics and Fingerprints: A Universal Representation for AI-Generated Image Detection
par: Wang, Zhiyuan, et autres
Publié: (2026)
par: Wang, Zhiyuan, et autres
Publié: (2026)
Selective Visual Representations Improve Convergence and Generalization for Embodied AI
par: Eftekhar, Ainaz, et autres
Publié: (2023)
par: Eftekhar, Ainaz, et autres
Publié: (2023)
Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques
par: Huang, Weijian, et autres
Publié: (2024)
par: Huang, Weijian, et autres
Publié: (2024)
Semantic-CC: Boosting Remote Sensing Image Change Captioning via Foundational Knowledge and Semantic Guidance
par: Zhu, Yongshuo, et autres
Publié: (2024)
par: Zhu, Yongshuo, et autres
Publié: (2024)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
par: Fang, Zhen, et autres
Publié: (2025)
par: Fang, Zhen, et autres
Publié: (2025)
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning
par: Ju, Yuanchen, et autres
Publié: (2025)
par: Ju, Yuanchen, et autres
Publié: (2025)
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
par: Qian, Kangan, et autres
Publié: (2026)
par: Qian, Kangan, et autres
Publié: (2026)
Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation
par: Ju, Yuanchen, et autres
Publié: (2024)
par: Ju, Yuanchen, et autres
Publié: (2024)
Training-free Camera Control for Video Generation
par: Hou, Chen, et autres
Publié: (2024)
par: Hou, Chen, et autres
Publié: (2024)
Deformable One-shot Face Stylization via DINO Semantic Guidance
par: Zhou, Yang, et autres
Publié: (2024)
par: Zhou, Yang, et autres
Publié: (2024)
Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
par: Wu, Yuanchen, et autres
Publié: (2025)
par: Wu, Yuanchen, et autres
Publié: (2025)
Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
par: Li, Yuanbo, et autres
Publié: (2026)
par: Li, Yuanbo, et autres
Publié: (2026)
AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
par: Zhou, Ziyin, et autres
Publié: (2025)
par: Zhou, Ziyin, et autres
Publié: (2025)
Locate n' Rotate: Two-stage Openable Part Detection with Foundation Model Priors
par: Li, Siqi, et autres
Publié: (2024)
par: Li, Siqi, et autres
Publié: (2024)
DuPL: Dual Student with Trustworthy Progressive Learning for Robust Weakly Supervised Semantic Segmentation
par: Wu, Yuanchen, et autres
Publié: (2024)
par: Wu, Yuanchen, et autres
Publié: (2024)
Semantic Image Synthesis via Diffusion Models
par: Zhou, Wengang, et autres
Publié: (2022)
par: Zhou, Wengang, et autres
Publié: (2022)
EmbodiedPlace: Learning Mixture-of-Features with Embodied Constraints for Visual Place Recognition
par: Liu, Bingxi, et autres
Publié: (2025)
par: Liu, Bingxi, et autres
Publié: (2025)
Learning Additively Compositional Latent Actions for Embodied AI
par: Wei, Hangxing, et autres
Publié: (2026)
par: Wei, Hangxing, et autres
Publié: (2026)
Narrowing Information Bottleneck Theory for Multimodal Image-Text Representations Interpretability
par: Zhu, Zhiyu, et autres
Publié: (2025)
par: Zhu, Zhiyu, et autres
Publié: (2025)
Light Field Compression Based on Implicit Neural Representation
par: Wang, Henan, et autres
Publié: (2024)
par: Wang, Henan, et autres
Publié: (2024)
Hierarchical Neural Semantic Representation for 3D Semantic Correspondence
par: Du, Keyu, et autres
Publié: (2025)
par: Du, Keyu, et autres
Publié: (2025)
Rein++: Efficient Generalization and Adaptation for Semantic Segmentation with Vision Foundation Models
par: Wei, Zhixiang, et autres
Publié: (2025)
par: Wei, Zhixiang, et autres
Publié: (2025)
Perception Matters: Enhancing Embodied AI with Uncertainty-Aware Semantic Segmentation
par: Prasanna, Sai, et autres
Publié: (2024)
par: Prasanna, Sai, et autres
Publié: (2024)
Semantically Structured Image Compression via Irregular Group-Based Decoupling
par: Feng, Ruoyu, et autres
Publié: (2023)
par: Feng, Ruoyu, et autres
Publié: (2023)
Weakly-Supervised Semantic Segmentation with Image-Level Labels: from Traditional Models to Foundation Models
par: Chen, Zhaozheng, et autres
Publié: (2023)
par: Chen, Zhaozheng, et autres
Publié: (2023)
GSemSplat: Generalizable Semantic 3D Gaussian Splatting from Uncalibrated Image Pairs
par: Wang, Xingrui, et autres
Publié: (2024)
par: Wang, Xingrui, et autres
Publié: (2024)
LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\times$RTX 4090s
par: Wang, Xijun, et autres
Publié: (2025)
par: Wang, Xijun, et autres
Publié: (2025)
Documents similaires
-
Embody4D: A Generalist 4D World Model for Embodied AI
par: Tu, Peiyan, et autres
Publié: (2026) -
SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space
par: Kang, Zejian, et autres
Publié: (2026) -
Multimodal Data Storage and Retrieval for Embodied AI: A Survey
par: Lu, Yihao, et autres
Publié: (2025) -
Improving Human Image Animation via Semantic Representation Alignment
par: Liu, Chang, et autres
Publié: (2026) -
KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes
par: Wu, Jingchao, et autres
Publié: (2025)