TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Yinyi, Wang, Wenwen, Bai, Hayes, Zhu, Hongyu, Chen, Hao, He, Pan, Savvides, Marios, Li, Sharon, Wang, Jindong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LatentUMM: Dual Latent Alignment for Unified Multimodal Models
par: Luo, Yinyi, et autres
Publié: (2026)
par: Luo, Yinyi, et autres
Publié: (2026)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
Self-Corrected Image Generation with Explainable Latent Rewards
par: Luo, Yinyi, et autres
Publié: (2026)
par: Luo, Yinyi, et autres
Publié: (2026)
KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning
par: Luo, Yinyi, et autres
Publié: (2025)
par: Luo, Yinyi, et autres
Publié: (2025)
FedUMM: A General Framework for Federated Learning with Unified Multimodal Models
par: Su, Zhaolong, et autres
Publié: (2026)
par: Su, Zhaolong, et autres
Publié: (2026)
Image Tokenizer Needs Post-Training
par: Qiu, Kai, et autres
Publié: (2025)
par: Qiu, Kai, et autres
Publié: (2025)
MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
UniGame: Turning a Unified Multimodal Model Into Its Own Adversary
par: Su, Zhaolong, et autres
Publié: (2025)
par: Su, Zhaolong, et autres
Publié: (2025)
A Unified Study of LoRA Variants: Taxonomy, Review, Codebase, and Empirical Evaluation
par: He, Haonan, et autres
Publié: (2026)
par: He, Haonan, et autres
Publié: (2026)
SOLAR: Scalable Optimization of Large-scale Architecture for Reasoning
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
An Embarrassingly Simple Baseline for Imbalanced Semi-Supervised Learning
par: Chen, Hao, et autres
Publié: (2022)
par: Chen, Hao, et autres
Publié: (2022)
Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis
par: Qiu, Kai, et autres
Publié: (2025)
par: Qiu, Kai, et autres
Publié: (2025)
Conv-Adapter: Exploring Parameter Efficient Transfer Learning for ConvNets
par: Chen, Hao, et autres
Publié: (2022)
par: Chen, Hao, et autres
Publié: (2022)
SciPost Physics Codebases
Publié: (2026)
Publié: (2026)
ChatUMM: Robust Context Tracking for Conversational Interleaved Generation
par: Dai, Wenxun, et autres
Publié: (2026)
par: Dai, Wenxun, et autres
Publié: (2026)
Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training
par: Sun, Peng, et autres
Publié: (2026)
par: Sun, Peng, et autres
Publié: (2026)
PromptBench: A Unified Library for Evaluation of Large Language Models
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning
par: Yao, Changwei, et autres
Publié: (2025)
par: Yao, Changwei, et autres
Publié: (2025)
OpenWorldLib: A Unified Codebase and Definition of Advanced World Models
par: DataFlow Team, et autres
Publié: (2026)
par: DataFlow Team, et autres
Publié: (2026)
RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation
par: Luo, Jane, et autres
Publié: (2025)
par: Luo, Jane, et autres
Publié: (2025)
On Fairness of Unified Multimodal Large Language Model for Image Generation
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
UniSD: Towards a Unified Self-Distillation Framework for Large Language Models
par: Jin, Yiqiao, et autres
Publié: (2026)
par: Jin, Yiqiao, et autres
Publié: (2026)
Self-Ensemble Post Learning for Noisy Domain Generalization
par: Lu, Wang, et autres
Publié: (2025)
par: Lu, Wang, et autres
Publié: (2025)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
par: Chen, Fangyi, et autres
Publié: (2024)
par: Chen, Fangyi, et autres
Publié: (2024)
Hierarchical Knowledge Graph Construction from Images for Scalable E-Commerce
par: Yang, Zhantao, et autres
Publié: (2024)
par: Yang, Zhantao, et autres
Publié: (2024)
TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training
par: Liang, Wanchao, et autres
Publié: (2024)
par: Liang, Wanchao, et autres
Publié: (2024)
MASLab: A Unified and Comprehensive Codebase for LLM-based Multi-Agent Systems
par: Ye, Rui, et autres
Publié: (2025)
par: Ye, Rui, et autres
Publié: (2025)
MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
par: Hou, Ruibing, et autres
Publié: (2025)
par: Hou, Ruibing, et autres
Publié: (2025)
ExecuTorch -- A Unified PyTorch Solution to Run AI Models On-Device
par: Nachin, Mergen, et autres
Publié: (2026)
par: Nachin, Mergen, et autres
Publié: (2026)
A CLIP-based Uncertainty Modal Modeling (UMM) Framework for Pedestrian Re-Identification in Autonomous Driving
par: Li, Jialin, et autres
Publié: (2025)
par: Li, Jialin, et autres
Publié: (2025)
Efficient Autoregressive Audio Modeling via Next-Scale Prediction
par: Qiu, Kai, et autres
Publié: (2024)
par: Qiu, Kai, et autres
Publié: (2024)
FormulaCode: Evaluating Agentic Optimization on Large Codebases
par: Sehgal, Atharva, et autres
Publié: (2026)
par: Sehgal, Atharva, et autres
Publié: (2026)
Neural Radiance Fields with Torch Units
par: Ni, Bingnan, et autres
Publié: (2024)
par: Ni, Bingnan, et autres
Publié: (2024)
STELAR-VISION: Self-Topology-Aware Efficient Learning for Aligned Reasoning in Vision
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
ForensicHub: A Unified Benchmark & Codebase for All-Domain Fake Image Detection and Localization
par: Du, Bo, et autres
Publié: (2025)
par: Du, Bo, et autres
Publié: (2025)
torchtune: PyTorch native post-training library
par: Obozov, Mark, et autres
Publié: (2026)
par: Obozov, Mark, et autres
Publié: (2026)
SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution
par: He, Kang, et autres
Publié: (2026)
par: He, Kang, et autres
Publié: (2026)
TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
par: Jia, Junlong, et autres
Publié: (2024)
par: Jia, Junlong, et autres
Publié: (2024)
When to Re-Commit: Temporal Abstraction Discovery for Long-Horizon Vision-Language Reasoning
par: Li, Chen, et autres
Publié: (2026)
par: Li, Chen, et autres
Publié: (2026)
Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models
par: Liang, Sichu, et autres
Publié: (2026)
par: Liang, Sichu, et autres
Publié: (2026)
Documents similaires
-
LatentUMM: Dual Latent Alignment for Unified Multimodal Models
par: Luo, Yinyi, et autres
Publié: (2026) -
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026) -
Self-Corrected Image Generation with Explainable Latent Rewards
par: Luo, Yinyi, et autres
Publié: (2026) -
KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning
par: Luo, Yinyi, et autres
Publié: (2025) -
FedUMM: A General Framework for Federated Learning with Unified Multimodal Models
par: Su, Zhaolong, et autres
Publié: (2026)