Play to Generalize: Learning to Reason Through Game Play
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Yunfei, Ma, Yinsong, Lan, Shiyi, Yuille, Alan, Xiao, Junfei, Wei, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
por: Xiao, Junfei, et al.
Publicado: (2023)
por: Xiao, Junfei, et al.
Publicado: (2023)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024)
por: Chen, Jiaxing, et al.
Publicado: (2024)
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
por: Tang, Yihong, et al.
Publicado: (2026)
por: Tang, Yihong, et al.
Publicado: (2026)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
por: Li, Zhuowan, et al.
Publicado: (2022)
por: Li, Zhuowan, et al.
Publicado: (2022)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
por: Xie, Yunfei, et al.
Publicado: (2024)
por: Xie, Yunfei, et al.
Publicado: (2024)
LibraGen: Playing a Balance Game in Subject-Driven Video Generation
por: Zhu, Jiahao, et al.
Publicado: (2026)
por: Zhu, Jiahao, et al.
Publicado: (2026)
Rejuvenating image-GPT as Strong Visual Representation Learners
por: Ren, Sucheng, et al.
Publicado: (2023)
por: Ren, Sucheng, et al.
Publicado: (2023)
From Virtual Games to Real-World Play
por: Sun, Wenqiang, et al.
Publicado: (2025)
por: Sun, Wenqiang, et al.
Publicado: (2025)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
por: Xiao, Junfei, et al.
Publicado: (2024)
por: Xiao, Junfei, et al.
Publicado: (2024)
VideoAuteur: Towards Long Narrative Video Generation
por: Xiao, Junfei, et al.
Publicado: (2025)
por: Xiao, Junfei, et al.
Publicado: (2025)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
por: Zhang, Tiezheng, et al.
Publicado: (2025)
por: Zhang, Tiezheng, et al.
Publicado: (2025)
Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting
por: Xu, Runze, et al.
Publicado: (2026)
por: Xu, Runze, et al.
Publicado: (2026)
Language Plays a Pivotal Role in the Object-Attribute Compositional Generalization of CLIP
por: Abbasi, Reza, et al.
Publicado: (2024)
por: Abbasi, Reza, et al.
Publicado: (2024)
Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation
por: Yuan, Huizhuo, et al.
Publicado: (2024)
por: Yuan, Huizhuo, et al.
Publicado: (2024)
OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction
por: Zhang, Haonan, et al.
Publicado: (2025)
por: Zhang, Haonan, et al.
Publicado: (2025)
Captain Safari: A World Engine with Pose-Aligned 3D Memory
por: Chou, Yu-Cheng, et al.
Publicado: (2025)
por: Chou, Yu-Cheng, et al.
Publicado: (2025)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
por: Chen, Jiali, et al.
Publicado: (2024)
por: Chen, Jiali, et al.
Publicado: (2024)
Quizzard@INOVA Challenge 2025 -- Track A: Plug-and-Play Technique in Interleaved Multi-Image Model
por: Cuong, Dinh Viet, et al.
Publicado: (2025)
por: Cuong, Dinh Viet, et al.
Publicado: (2025)
MMGR: Multi-Modal Generative Reasoning
por: Cai, Zefan, et al.
Publicado: (2025)
por: Cai, Zefan, et al.
Publicado: (2025)
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
por: Zhang, Junlei, et al.
Publicado: (2025)
por: Zhang, Junlei, et al.
Publicado: (2025)
GenEx: Generating an Explorable World
por: Lu, Taiming, et al.
Publicado: (2024)
por: Lu, Taiming, et al.
Publicado: (2024)
Thinking with Spatial Code for Physical-World Video Reasoning
por: Chen, Jieneng, et al.
Publicado: (2026)
por: Chen, Jieneng, et al.
Publicado: (2026)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
por: Ma, Wufei, et al.
Publicado: (2025)
por: Ma, Wufei, et al.
Publicado: (2025)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
por: Ma, Jian, et al.
Publicado: (2023)
por: Ma, Jian, et al.
Publicado: (2023)
Captain Cinema: Towards Short Movie Generation
por: Xiao, Junfei, et al.
Publicado: (2025)
por: Xiao, Junfei, et al.
Publicado: (2025)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
por: Huang, Yixu, et al.
Publicado: (2026)
por: Huang, Yixu, et al.
Publicado: (2026)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
por: Ren, Sucheng, et al.
Publicado: (2024)
por: Ren, Sucheng, et al.
Publicado: (2024)
DINeMo: Learning Neural Mesh Models with no 3D Annotations
por: Guo, Weijie, et al.
Publicado: (2025)
por: Guo, Weijie, et al.
Publicado: (2025)
Playing for 3D Human Recovery
por: Cai, Zhongang, et al.
Publicado: (2021)
por: Cai, Zhongang, et al.
Publicado: (2021)
PnP-U3D: Plug-and-Play 3D Framework Bridging Autoregression and Diffusion for Unified Understanding and Generation
por: Chen, Yongwei, et al.
Publicado: (2026)
por: Chen, Yongwei, et al.
Publicado: (2026)
An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Plug-and-Play Diffusion Distillation
por: Hsiao, Yi-Ting, et al.
Publicado: (2024)
por: Hsiao, Yi-Ting, et al.
Publicado: (2024)
Large Language Models are Universal Reasoners for Visual Generation
por: Ren, Sucheng, et al.
Publicado: (2026)
por: Ren, Sucheng, et al.
Publicado: (2026)
When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?
por: Liang, Tuo, et al.
Publicado: (2025)
por: Liang, Tuo, et al.
Publicado: (2025)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
por: Mao, Weian, et al.
Publicado: (2026)
por: Mao, Weian, et al.
Publicado: (2026)
Vision-Braille: A Curriculum Learning Toolkit and Braille-Chinese Corpus for Braille Translation
por: Wu, Alan, et al.
Publicado: (2024)
por: Wu, Alan, et al.
Publicado: (2024)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
por: Yuille, Alan, et al.
Publicado: (2026)
por: Yuille, Alan, et al.
Publicado: (2026)
EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory
por: Wang, Jiahao, et al.
Publicado: (2025)
por: Wang, Jiahao, et al.
Publicado: (2025)
Ejemplares similares
-
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
por: Xiao, Junfei, et al.
Publicado: (2023) -
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024) -
Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent
por: Tang, Yihong, et al.
Publicado: (2026) -
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
por: Li, Zhuowan, et al.
Publicado: (2022) -
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
por: Xie, Yunfei, et al.
Publicado: (2024)