V2M: Visual 2-Dimensional Mamba for Image Representation Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chengkun, Zheng, Wenzhao, Huang, Yuanhui, Zhou, Jie, Lu, Jiwen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GlobalMamba: Global Image Serialization for Vision Mamba
par: Wang, Chengkun, et autres
Publié: (2024)
par: Wang, Chengkun, et autres
Publié: (2024)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
SpectralAR: Spectral Autoregressive Visual Generation
par: Huang, Yuanhui, et autres
Publié: (2025)
par: Huang, Yuanhui, et autres
Publié: (2025)
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
par: Zuo, Sicheng, et autres
Publié: (2024)
par: Zuo, Sicheng, et autres
Publié: (2024)
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
par: Dong, Jiajun, et autres
Publié: (2025)
par: Dong, Jiajun, et autres
Publié: (2025)
Moaw: Unleashing Motion Awareness for Video Diffusion Models
par: Zhang, Tianqi, et autres
Publié: (2026)
par: Zhang, Tianqi, et autres
Publié: (2026)
Doe-1: Closed-Loop Autonomous Driving with Large World Model
par: Zheng, Wenzhao, et autres
Publié: (2024)
par: Zheng, Wenzhao, et autres
Publié: (2024)
EmbodiedOcc: Embodied 3D Occupancy Prediction for Vision-based Online Scene Understanding
par: Wu, Yuqi, et autres
Publié: (2024)
par: Wu, Yuqi, et autres
Publié: (2024)
GaussianFormer-2: Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
Joint 3D Geometry Reconstruction and Motion Generation for 4D Synthesis from a Single Image
par: Zhang, Yanran, et autres
Publié: (2025)
par: Zhang, Yanran, et autres
Publié: (2025)
OGGSplat: Open Gaussian Growing for Generalizable Reconstruction with Expanded Field-of-View
par: Wang, Yanbo, et autres
Publié: (2025)
par: Wang, Yanbo, et autres
Publié: (2025)
Terra: Explorable Native 3D World Model with Point Latents
par: Huang, Yuanhui, et autres
Publié: (2025)
par: Huang, Yuanhui, et autres
Publié: (2025)
Path Choice Matters for Clear Attribution in Path Methods
par: Zhang, Borui, et autres
Publié: (2024)
par: Zhang, Borui, et autres
Publié: (2024)
Preventing Local Pitfalls in Vector Quantization via Optimal Transport
par: Zhang, Borui, et autres
Publié: (2024)
par: Zhang, Borui, et autres
Publié: (2024)
Owl-1: Omni World Model for Consistent Long Video Generation
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos
par: Dou, Weijia, et autres
Publié: (2026)
par: Dou, Weijia, et autres
Publié: (2026)
Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
par: Wu, Yuqi, et autres
Publié: (2025)
par: Wu, Yuqi, et autres
Publié: (2025)
UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
par: Zhang, Yanran, et autres
Publié: (2026)
par: Zhang, Yanran, et autres
Publié: (2026)
Streaming 4D Visual Geometry Transformer
par: Zhuo, Dong, et autres
Publié: (2025)
par: Zhuo, Dong, et autres
Publié: (2025)
SFTok: Bridging the Performance Gap in Discrete Tokenizers
par: Rao, Qihang, et autres
Publié: (2025)
par: Rao, Qihang, et autres
Publié: (2025)
Quantize-then-Rectify: Efficient VQ-VAE Training
par: Zhang, Borui, et autres
Publié: (2025)
par: Zhang, Borui, et autres
Publié: (2025)
Fast Shapley Value Estimation: A Unified Approach
par: Zhang, Borui, et autres
Publié: (2023)
par: Zhang, Borui, et autres
Publié: (2023)
Vega: Learning to Drive with Natural Language Instructions
par: Zuo, Sicheng, et autres
Publié: (2026)
par: Zuo, Sicheng, et autres
Publié: (2026)
NeXT-IMDL: Build Benchmark for NeXT-Generation Image Manipulation Detection & Localization
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
$\bf{D^3}$QE: Learning Discrete Distribution Discrepancy-aware Quantization Error for Autoregressive-Generated Image Detection
par: Zhang, Yanran, et autres
Publié: (2025)
par: Zhang, Yanran, et autres
Publié: (2025)
GenWorld: Towards Detecting AI-generated Real-world Simulation Videos
par: Chen, Weiliang, et autres
Publié: (2025)
par: Chen, Weiliang, et autres
Publié: (2025)
SceneCompleter: Dense 3D Scene Completion for Generative Novel View Synthesis
par: Chen, Weiliang, et autres
Publié: (2025)
par: Chen, Weiliang, et autres
Publié: (2025)
Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
WaterVIB: Learning Minimal Sufficient Watermark Representations via Variational Information Bottleneck
par: He, Haoyuan, et autres
Publié: (2026)
par: He, Haoyuan, et autres
Publié: (2026)
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
par: Zhuo, Dong, et autres
Publié: (2026)
par: Zhuo, Dong, et autres
Publié: (2026)
Wavelet-Driven Masked Image Modeling: A Path to Efficient Visual Representation
par: Xiang, Wenzhao, et autres
Publié: (2025)
par: Xiang, Wenzhao, et autres
Publié: (2025)
SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
par: Shi, Minglei, et autres
Publié: (2025)
par: Shi, Minglei, et autres
Publié: (2025)
QuadricFormer: Scene as Superquadrics for 3D Semantic Occupancy Prediction
par: Zuo, Sicheng, et autres
Publié: (2025)
par: Zuo, Sicheng, et autres
Publié: (2025)
Hardness-Aware Scene Synthesis for Semi-Supervised 3D Object Detection
par: Zeng, Shuai, et autres
Publié: (2024)
par: Zeng, Shuai, et autres
Publié: (2024)
MaskMamba: A Hybrid Mamba-Transformer Model for Masked Image Generation
par: Chen, Wenchao, et autres
Publié: (2024)
par: Chen, Wenchao, et autres
Publié: (2024)
Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation
par: Gong, Boyang, et autres
Publié: (2026)
par: Gong, Boyang, et autres
Publié: (2026)
Learning Dual-Level Deformable Implicit Representation for Real-World Scale Arbitrary Super-Resolution
par: Li, Zhiheng, et autres
Publié: (2024)
par: Li, Zhiheng, et autres
Publié: (2024)
DC-Solver: Improving Predictor-Corrector Diffusion Sampler via Dynamic Compensation
par: Zhao, Wenliang, et autres
Publié: (2024)
par: Zhao, Wenliang, et autres
Publié: (2024)
FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner
par: Zhao, Wenliang, et autres
Publié: (2024)
par: Zhao, Wenliang, et autres
Publié: (2024)
Pseudo Depth Meets Gaussian: A Feed-forward RGB SLAM Baseline
par: Zhao, Linqing, et autres
Publié: (2025)
par: Zhao, Linqing, et autres
Publié: (2025)
Documents similaires
-
GlobalMamba: Global Image Serialization for Vision Mamba
par: Wang, Chengkun, et autres
Publié: (2024) -
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
par: Huang, Yuanhui, et autres
Publié: (2024) -
SpectralAR: Spectral Autoregressive Visual Generation
par: Huang, Yuanhui, et autres
Publié: (2025) -
GaussianWorld: Gaussian World Model for Streaming 3D Occupancy Prediction
par: Zuo, Sicheng, et autres
Publié: (2024) -
GaussianToken: An Effective Image Tokenizer with 2D Gaussian Splatting
par: Dong, Jiajun, et autres
Publié: (2025)