Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Shixiang, Wang, Yizhou, Chen, Lu, Wang, Yuan, Peng, Sida, Xu, Dan, Ouyang, Wanli |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
par: Wu, Haoning, et autres
Publié: (2023)
par: Wu, Haoning, et autres
Publié: (2023)
EgoAgent: A Joint Predictive Agent Model in Egocentric Worlds
par: Chen, Lu, et autres
Publié: (2025)
par: Chen, Lu, et autres
Publié: (2025)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
par: Huang, Yuesheng, et autres
Publié: (2025)
par: Huang, Yuesheng, et autres
Publié: (2025)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
par: Yuan, Hangjie, et autres
Publié: (2025)
par: Yuan, Hangjie, et autres
Publié: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
par: Ma, Jianzhe, et autres
Publié: (2026)
par: Ma, Jianzhe, et autres
Publié: (2026)
HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
par: Cai, Qi, et autres
Publié: (2025)
par: Cai, Qi, et autres
Publié: (2025)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
par: Yang, Jialiang, et autres
Publié: (2026)
par: Yang, Jialiang, et autres
Publié: (2026)
A User-Friendly Framework for Generating Model-Preferred Prompts in Text-to-Image Synthesis
par: Hei, Nailei, et autres
Publié: (2024)
par: Hei, Nailei, et autres
Publié: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
par: Wang, Yun, et autres
Publié: (2025)
par: Wang, Yun, et autres
Publié: (2025)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
par: Xuan, Yunyi, et autres
Publié: (2024)
par: Xuan, Yunyi, et autres
Publié: (2024)
Unified Coding for Both Human Perception and Generalized Machine Analytics with CLIP Supervision
par: Yin, Kangsheng, et autres
Publié: (2025)
par: Yin, Kangsheng, et autres
Publié: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
par: Cai, Qi, et autres
Publié: (2026)
par: Cai, Qi, et autres
Publié: (2026)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
par: Zhang, Yuang, et autres
Publié: (2024)
par: Zhang, Yuang, et autres
Publié: (2024)
Scaling Spatial Intelligence with Multimodal Foundation Models
par: Cai, Zhongang, et autres
Publié: (2025)
par: Cai, Zhongang, et autres
Publié: (2025)
Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation
par: Cao, Pu, et autres
Publié: (2023)
par: Cao, Pu, et autres
Publié: (2023)
Hulk: A Universal Knowledge Translator for Human-Centric Tasks
par: Wang, Yizhou, et autres
Publié: (2023)
par: Wang, Yizhou, et autres
Publié: (2023)
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
par: Cai, Zhuoxuan, et autres
Publié: (2025)
par: Cai, Zhuoxuan, et autres
Publié: (2025)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
par: Shi, Chuancheng, et autres
Publié: (2026)
par: Shi, Chuancheng, et autres
Publié: (2026)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
par: Qu, Qiang, et autres
Publié: (2025)
par: Qu, Qiang, et autres
Publié: (2025)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
par: Li, Liupeng, et autres
Publié: (2026)
par: Li, Liupeng, et autres
Publié: (2026)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
par: Sun, Zeyi, et autres
Publié: (2024)
par: Sun, Zeyi, et autres
Publié: (2024)
Robust Fuzzy Multi-view Learning under View Conflict
par: Duan, Siyuan, et autres
Publié: (2026)
par: Duan, Siyuan, et autres
Publié: (2026)
Can Large Language Models Grasp Event Signals? Exploring Pure Zero-Shot Event-based Recognition
par: Yu, Zongyou, et autres
Publié: (2024)
par: Yu, Zongyou, et autres
Publié: (2024)
PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models
par: Zhang, Yongjian, et autres
Publié: (2025)
par: Zhang, Yongjian, et autres
Publié: (2025)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
par: Zhang, Miaosen, et autres
Publié: (2025)
par: Zhang, Miaosen, et autres
Publié: (2025)
Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation
par: Yu, Lijun, et autres
Publié: (2023)
par: Yu, Lijun, et autres
Publié: (2023)
VDE Bench: Evaluating The Capability of Image Editing Models to Modify Visual Documents
par: Yi, Hongzhu, et autres
Publié: (2026)
par: Yi, Hongzhu, et autres
Publié: (2026)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Cai, Dongnuan, et autres
Publié: (2026)
par: Cai, Dongnuan, et autres
Publié: (2026)
SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation
par: Chen, Tong, et autres
Publié: (2024)
par: Chen, Tong, et autres
Publié: (2024)
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
par: Zhang, Yanjie, et autres
Publié: (2026)
par: Zhang, Yanjie, et autres
Publié: (2026)
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
par: Ouyang, Shuyi, et autres
Publié: (2024)
par: Ouyang, Shuyi, et autres
Publié: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
par: Wang, Xiao, et autres
Publié: (2023)
par: Wang, Xiao, et autres
Publié: (2023)
Audio-Guided Visual Perception for Audio-Visual Navigation
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
par: Zhong, Zhisheng, et autres
Publié: (2024)
par: Zhong, Zhisheng, et autres
Publié: (2024)
TIDE : Temporal-Aware Sparse Autoencoders for Interpretable Diffusion Transformers in Image Generation
par: Huang, Victor Shea-Jay, et autres
Publié: (2025)
par: Huang, Victor Shea-Jay, et autres
Publié: (2025)
Documents similaires
-
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
par: Wu, Haoning, et autres
Publié: (2023) -
EgoAgent: A Joint Predictive Agent Model in Egocentric Worlds
par: Chen, Lu, et autres
Publié: (2025) -
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
par: Huang, Yuesheng, et autres
Publié: (2025) -
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025) -
Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective
par: Yuan, Hangjie, et autres
Publié: (2025)