Test-Time Training Done Right
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Tianyuan, Bi, Sai, Hong, Yicong, Zhang, Kai, Luan, Fujun, Yang, Songlin, Sunkavalli, Kalyan, Freeman, William T., Tan, Hao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MeshLRM: Large Reconstruction Model for High-Quality Meshes
by: Wei, Xinyue, et al.
Published: (2024)
by: Wei, Xinyue, et al.
Published: (2024)
Neural Directional Encoding for Efficient and Accurate View-Dependent Appearance Modeling
by: Wu, Liwen, et al.
Published: (2024)
by: Wu, Liwen, et al.
Published: (2024)
tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction
by: Wang, Chen, et al.
Published: (2026)
by: Wang, Chen, et al.
Published: (2026)
Long-LRM: Long-sequence Large Reconstruction Model for Wide-coverage Gaussian Splats
by: Ziwen, Chen, et al.
Published: (2024)
by: Ziwen, Chen, et al.
Published: (2024)
RayZer: A Self-supervised Large View Synthesis Model
by: Jiang, Hanwen, et al.
Published: (2025)
by: Jiang, Hanwen, et al.
Published: (2025)
GS-LRM: Large Reconstruction Model for 3D Gaussian Splatting
by: Zhang, Kai, et al.
Published: (2024)
by: Zhang, Kai, et al.
Published: (2024)
LRM: Large Reconstruction Model for Single Image to 3D
by: Hong, Yicong, et al.
Published: (2023)
by: Hong, Yicong, et al.
Published: (2023)
E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training
by: Zhao, Qitao, et al.
Published: (2025)
by: Zhao, Qitao, et al.
Published: (2025)
DATENeRF: Depth-Aware Text-based Editing of NeRFs
by: Rojas, Sara, et al.
Published: (2024)
by: Rojas, Sara, et al.
Published: (2024)
RandAR: Decoder-only Autoregressive Visual Generation in Random Orders
by: Pang, Ziqi, et al.
Published: (2024)
by: Pang, Ziqi, et al.
Published: (2024)
EP-CFG: Energy-Preserving Classifier-Free Guidance
by: Zhang, Kai, et al.
Published: (2024)
by: Zhang, Kai, et al.
Published: (2024)
RelitLRM: Generative Relightable Radiance for Large Reconstruction Models
by: Zhang, Tianyuan, et al.
Published: (2024)
by: Zhang, Tianyuan, et al.
Published: (2024)
LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias
by: Jin, Haian, et al.
Published: (2024)
by: Jin, Haian, et al.
Published: (2024)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
by: Zhou, Gengze, et al.
Published: (2025)
by: Zhou, Gengze, et al.
Published: (2025)
Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors
by: Kuang, Zhengfei, et al.
Published: (2024)
by: Kuang, Zhengfei, et al.
Published: (2024)
4D-LRM: Large Space-Time Reconstruction Model From and To Any View at Any Time
by: Ma, Ziqiao, et al.
Published: (2025)
by: Ma, Ziqiao, et al.
Published: (2025)
NeuManifold: Neural Watertight Manifold Reconstruction with Efficient and High-Quality Rendering Support
by: Wei, Xinyue, et al.
Published: (2023)
by: Wei, Xinyue, et al.
Published: (2023)
KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos
by: Chou, Gene, et al.
Published: (2024)
by: Chou, Gene, et al.
Published: (2024)
Neural BRDF Importance Sampling by Reparameterization
by: Wu, Liwen, et al.
Published: (2025)
by: Wu, Liwen, et al.
Published: (2025)
RELIC: Interactive Video World Model with Long-Horizon Memory
by: Hong, Yicong, et al.
Published: (2025)
by: Hong, Yicong, et al.
Published: (2025)
Gaussian Mixture Flow Matching Models
by: Chen, Hansheng, et al.
Published: (2025)
by: Chen, Hansheng, et al.
Published: (2025)
Turbo3D: Ultra-fast Text-to-3D Generation
by: Hu, Hanzhe, et al.
Published: (2024)
by: Hu, Hanzhe, et al.
Published: (2024)
Batch Speculative Decoding Done Right
by: Zhang, Ranran Haoran, et al.
Published: (2025)
by: Zhang, Ranran Haoran, et al.
Published: (2025)
Fine-tuning Done Right in Model Editing
by: Yang, Wanli, et al.
Published: (2025)
by: Yang, Wanli, et al.
Published: (2025)
Classification Done Right for Vision-Language Pre-Training
by: Huang, Zilong, et al.
Published: (2024)
by: Huang, Zilong, et al.
Published: (2024)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
by: Yu, Shoubin, et al.
Published: (2025)
by: Yu, Shoubin, et al.
Published: (2025)
Is Extending Modality The Right Path Towards Omni-Modality?
by: Zhu, Tinghui, et al.
Published: (2025)
by: Zhu, Tinghui, et al.
Published: (2025)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
by: Chen, Bowei, et al.
Published: (2025)
by: Chen, Bowei, et al.
Published: (2025)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
by: Acuna, David, et al.
Published: (2025)
by: Acuna, David, et al.
Published: (2025)
Banking Done Right: Redefining Retail Banking with Language-Centric AI
by: Chua, Xin Jie, et al.
Published: (2025)
by: Chua, Xin Jie, et al.
Published: (2025)
PBIR-NIE: Glossy Object Capture under Non-Distant Lighting
by: Cai, Guangyan, et al.
Published: (2024)
by: Cai, Guangyan, et al.
Published: (2024)
Panorama Generation From NFoV Image Done Right
by: Zheng, Dian, et al.
Published: (2025)
by: Zheng, Dian, et al.
Published: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
by: Wang, Ye, et al.
Published: (2025)
by: Wang, Ye, et al.
Published: (2025)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
by: Cheng, Daixuan, et al.
Published: (2024)
by: Cheng, Daixuan, et al.
Published: (2024)
Inference Compute-Optimal Video Vision Language Models
by: Wang, Peiqi, et al.
Published: (2025)
by: Wang, Peiqi, et al.
Published: (2025)
KnapFormer: An Online Load Balancer for Efficient Diffusion Transformers Training
by: Zhang, Kai, et al.
Published: (2025)
by: Zhang, Kai, et al.
Published: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
by: Tan, Zhiyu, et al.
Published: (2024)
by: Tan, Zhiyu, et al.
Published: (2024)
ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
by: Li, Zechen, et al.
Published: (2025)
by: Li, Zechen, et al.
Published: (2025)
OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation
by: Liu, Yuheng, et al.
Published: (2026)
by: Liu, Yuheng, et al.
Published: (2026)
HyperWalker: Dynamic Hypergraph-Based Deep Diagnosis for Multi-Hop Clinical Modeling across EHR and X-Ray in Medical VLMs
by: Yang, Yuezhe, et al.
Published: (2026)
by: Yang, Yuezhe, et al.
Published: (2026)
Similar Items
-
MeshLRM: Large Reconstruction Model for High-Quality Meshes
by: Wei, Xinyue, et al.
Published: (2024) -
Neural Directional Encoding for Efficient and Accurate View-Dependent Appearance Modeling
by: Wu, Liwen, et al.
Published: (2024) -
tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction
by: Wang, Chen, et al.
Published: (2026) -
Long-LRM: Long-sequence Large Reconstruction Model for Wide-coverage Gaussian Splats
by: Ziwen, Chen, et al.
Published: (2024) -
RayZer: A Self-supervised Large View Synthesis Model
by: Jiang, Hanwen, et al.
Published: (2025)