WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zizun, Zhou, Jianjun, Wang, Yifan, Guo, Haoyu, Chang, Wenzheng, Zhou, Yang, Zhu, Haoyi, Chen, Junyi, Shen, Chunhua, He, Tong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
$π^3$: Permutation-Equivariant Visual Geometry Learning
von: Wang, Yifan, et al.
Veröffentlicht: (2025)
von: Wang, Yifan, et al.
Veröffentlicht: (2025)
Aether: Geometric-Aware Unified World Modeling
von: Aether Team, et al.
Veröffentlicht: (2025)
von: Aether Team, et al.
Veröffentlicht: (2025)
DeepVerse: 4D Autoregressive Video Generation as a World Model
von: Chen, Junyi, et al.
Veröffentlicht: (2025)
von: Chen, Junyi, et al.
Veröffentlicht: (2025)
Geo-Align: Video Generation Alignment via Metric Geometry Reward
von: Li, Zizun, et al.
Veröffentlicht: (2026)
von: Li, Zizun, et al.
Veröffentlicht: (2026)
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
von: Zhou, Yang, et al.
Veröffentlicht: (2025)
von: Zhou, Yang, et al.
Veröffentlicht: (2025)
GHOST: Geometry-Hierarchical Online Streaming Token Eviction for Efficient 3D Reconstruction
von: Chen, Leyang, et al.
Veröffentlicht: (2026)
von: Chen, Leyang, et al.
Veröffentlicht: (2026)
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
von: Guo, Yiwei, et al.
Veröffentlicht: (2026)
HoneyWin: High-Interaction Windows Honeypot in Enterprise Environment
von: Aung, Yan Lin, et al.
Veröffentlicht: (2025)
von: Aung, Yan Lin, et al.
Veröffentlicht: (2025)
Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
von: Wang, Yifan, et al.
Veröffentlicht: (2026)
Win-Win: Training High-Resolution Vision Transformers from Two Windows
von: Leroy, Vincent, et al.
Veröffentlicht: (2023)
von: Leroy, Vincent, et al.
Veröffentlicht: (2023)
BRIDGE -- Building Reinforcement-Learning Depth-to-Image Data Generation Engine for Monocular Depth Estimation
von: Liu, Dingning, et al.
Veröffentlicht: (2025)
von: Liu, Dingning, et al.
Veröffentlicht: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
von: Wang, Yating, et al.
Veröffentlicht: (2025)
von: Wang, Yating, et al.
Veröffentlicht: (2025)
LCPR: A Multi-Scale Attention-Based LiDAR-Camera Fusion Network for Place Recognition
von: Zhou, Zijie, et al.
Veröffentlicht: (2023)
von: Zhou, Zijie, et al.
Veröffentlicht: (2023)
HieraTok: Multi-Scale Visual Tokenizer Improves Image Reconstruction and Generation
von: Chen, Cong, et al.
Veröffentlicht: (2025)
von: Chen, Cong, et al.
Veröffentlicht: (2025)
Random Wins All: Rethinking Grouping Strategies for Vision Tokens
von: Fan, Qihang, et al.
Veröffentlicht: (2026)
von: Fan, Qihang, et al.
Veröffentlicht: (2026)
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
von: Zuo, Fengrui, et al.
Veröffentlicht: (2026)
von: Zuo, Fengrui, et al.
Veröffentlicht: (2026)
Tide Pools: Windows Between Land and Sea
Veröffentlicht: (1986)
Veröffentlicht: (1986)
Handows: A Palm-Based Interactive Multi-Window Management System in Virtual Reality
von: Wang, Jindu, et al.
Veröffentlicht: (2025)
von: Wang, Jindu, et al.
Veröffentlicht: (2025)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
von: Wu, Yuqi, et al.
Veröffentlicht: (2025)
von: Wu, Yuqi, et al.
Veröffentlicht: (2025)
GigaGS: Scaling up Planar-Based 3D Gaussians for Large Scene Surface Reconstruction
von: Chen, Junyi, et al.
Veröffentlicht: (2024)
von: Chen, Junyi, et al.
Veröffentlicht: (2024)
Window Token Concatenation for Efficient Visual Large Language Models
von: Li, Yifan, et al.
Veröffentlicht: (2025)
von: Li, Yifan, et al.
Veröffentlicht: (2025)
Beyond Win Rates: A Clustering-Based Approach to Character Balance Analysis in Team-Based Games
von: Zhou, Haokun
Veröffentlicht: (2025)
von: Zhou, Haokun
Veröffentlicht: (2025)
Topological Mapping and Navigation using a Monocular Camera based on AnyLoc
von: Zhang, Wenzheng, et al.
Veröffentlicht: (2026)
von: Zhang, Wenzheng, et al.
Veröffentlicht: (2026)
Ensure Timeliness and Accuracy: A Novel Sliding Window Data Stream Paradigm for Live Streaming Recommendation
von: Liang, Fengqi, et al.
Veröffentlicht: (2024)
von: Liang, Fengqi, et al.
Veröffentlicht: (2024)
PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm
von: Zhu, Haoyi, et al.
Veröffentlicht: (2023)
von: Zhu, Haoyi, et al.
Veröffentlicht: (2023)
On the Effectiveness of Hybrid Pooling in Mixup-Based Graph Learning for Language Processing
von: Dong, Zeming, et al.
Veröffentlicht: (2022)
von: Dong, Zeming, et al.
Veröffentlicht: (2022)
TurboMem: High-Performance Lock-Free Memory Pool with Transparent Huge Page Auto-Merging for DPDK
von: Yang, Junyi
Veröffentlicht: (2026)
von: Yang, Junyi
Veröffentlicht: (2026)
Mini-Giants: "Small" Language Models and Open Source Win-Win
von: Zhou, Zhengping, et al.
Veröffentlicht: (2023)
von: Zhou, Zhengping, et al.
Veröffentlicht: (2023)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
von: Guo, Dake, et al.
Veröffentlicht: (2025)
von: Guo, Dake, et al.
Veröffentlicht: (2025)
Power-Efficient Memory Bus Encoding Using Stride-Based Stream Reconstruction
von: Kuei-Chung Chang
Veröffentlicht: (2007)
von: Kuei-Chung Chang
Veröffentlicht: (2007)
Dual‐Window Broadband Near‐Infrared Mechanoluminescence in MgO‐Based Phosphors
von: Yiyu Cai, et al.
Veröffentlicht: (2026)
von: Yiyu Cai, et al.
Veröffentlicht: (2026)
Dataflow-Based Optimization for Quantum Intermediate Representation Programs
von: Luo, Junjie, et al.
Veröffentlicht: (2024)
von: Luo, Junjie, et al.
Veröffentlicht: (2024)
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
von: Chen, Huamin, et al.
Veröffentlicht: (2026)
von: Chen, Huamin, et al.
Veröffentlicht: (2026)
Localization Through Particle Filter Powered Neural Network Estimated Monocular Camera Poses
von: Shen, Yi, et al.
Veröffentlicht: (2024)
von: Shen, Yi, et al.
Veröffentlicht: (2024)
Construction Mechanisms and Management Strategies for Win‐Win Ecosystem From a Multi‐Scale Perspective in the Wujiang River Basin
von: Junyi Yang, et al.
Veröffentlicht: (2025)
von: Junyi Yang, et al.
Veröffentlicht: (2025)
Near-Memory Architecture for Threshold-Ordinal Surface-Based Corner Detection of Event Cameras
von: Shang, Hongyang, et al.
Veröffentlicht: (2025)
von: Shang, Hongyang, et al.
Veröffentlicht: (2025)
Flow-Based Visual Stream Compression for Event Cameras
von: Stumpp, Daniel C., et al.
Veröffentlicht: (2024)
von: Stumpp, Daniel C., et al.
Veröffentlicht: (2024)
A Survey of 3D Reconstruction with Event Cameras
von: Xu, Chuanzhi, et al.
Veröffentlicht: (2025)
von: Xu, Chuanzhi, et al.
Veröffentlicht: (2025)
Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
Observation of Young's double-slit phenomenon in anti-PT-symmetric electrical circuits
von: Pan, Keyu, et al.
Veröffentlicht: (2024)
von: Pan, Keyu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
$π^3$: Permutation-Equivariant Visual Geometry Learning
von: Wang, Yifan, et al.
Veröffentlicht: (2025) -
Aether: Geometric-Aware Unified World Modeling
von: Aether Team, et al.
Veröffentlicht: (2025) -
DeepVerse: 4D Autoregressive Video Generation as a World Model
von: Chen, Junyi, et al.
Veröffentlicht: (2025) -
Geo-Align: Video Generation Alignment via Metric Geometry Reward
von: Li, Zizun, et al.
Veröffentlicht: (2026) -
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
von: Zhou, Yang, et al.
Veröffentlicht: (2025)