ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Weixian, Ge, Yixiao, Zhang, Jianfeng, Sun, Dylan, Yi, Kun, Shan, Ying, Shou, Mike Zheng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViT-Lens: Towards Omni-modal Representations
par: Lei, Weixian, et autres
Publié: (2023)
par: Lei, Weixian, et autres
Publié: (2023)
Let ViT Speak: Generative Language-Image Pre-training
par: Fang, Yan, et autres
Publié: (2026)
par: Fang, Yan, et autres
Publié: (2026)
ViT Registers and Fractal ViT
par: Chou, Jason Chuan-Chih, et autres
Publié: (2026)
par: Chou, Jason Chuan-Chih, et autres
Publié: (2026)
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
par: Kim, Ye-eun, et autres
Publié: (2025)
par: Kim, Ye-eun, et autres
Publié: (2025)
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
par: Song, Yiren, et autres
Publié: (2025)
par: Song, Yiren, et autres
Publié: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
OmniPSD: Layered PSD Generation with Diffusion Transformer
par: Liu, Cheng, et autres
Publié: (2025)
par: Liu, Cheng, et autres
Publié: (2025)
ViT$^3$: Unlocking Test-Time Training in Vision
par: Han, Dongchen, et autres
Publié: (2025)
par: Han, Dongchen, et autres
Publié: (2025)
MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer
par: Tai, Yu-Shan, et autres
Publié: (2024)
par: Tai, Yu-Shan, et autres
Publié: (2024)
SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection
par: Papais, Sandro, et autres
Publié: (2026)
par: Papais, Sandro, et autres
Publié: (2026)
OmniPatch: A Universal Adversarial Patch for ViT-CNN Cross-Architecture Transfer in Semantic Segmentation
par: Aggarwal, Aarush, et autres
Publié: (2026)
par: Aggarwal, Aarush, et autres
Publié: (2026)
GEB+: A Benchmark for Generic Event Boundary Captioning, Grounding and Retrieval
par: Wang, Yuxuan, et autres
Publié: (2022)
par: Wang, Yuxuan, et autres
Publié: (2022)
Deeper Inside Deep ViT
par: Hong, Sungrae
Publié: (2025)
par: Hong, Sungrae
Publié: (2025)
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
par: Zhong, Yunshan, et autres
Publié: (2023)
par: Zhong, Yunshan, et autres
Publié: (2023)
CLAMP-ViT: Contrastive Data-Free Learning for Adaptive Post-Training Quantization of ViTs
par: Ramachandran, Akshat, et autres
Publié: (2024)
par: Ramachandran, Akshat, et autres
Publié: (2024)
ODE-ViT: Plug & Play Attention Layer from the Generalization of the ViT as an Ordinary Differential Equation
par: Riera, Carlos Boned, et autres
Publié: (2025)
par: Riera, Carlos Boned, et autres
Publié: (2025)
STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs
par: Chattopadhyay, Nandish, et autres
Publié: (2026)
par: Chattopadhyay, Nandish, et autres
Publié: (2026)
Accelerating ViT Inference on FPGA through Static and Dynamic Pruning
par: Parikh, Dhruv, et autres
Publié: (2024)
par: Parikh, Dhruv, et autres
Publié: (2024)
ViTCAE: ViT-based Class-conditioned Autoencoder
par: Jebraeeli, Vahid, et autres
Publié: (2025)
par: Jebraeeli, Vahid, et autres
Publié: (2025)
HydraViT: Stacking Heads for a Scalable ViT
par: Haberer, Janek, et autres
Publié: (2024)
par: Haberer, Janek, et autres
Publié: (2024)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
OmniLens: Towards Universal Lens Aberration Correction via LensLib-to-Specific Domain Adaptation
par: Jiang, Qi, et autres
Publié: (2024)
par: Jiang, Qi, et autres
Publié: (2024)
Mobile U-ViT: Revisiting large kernel and U-shaped ViT for efficient medical image segmentation
par: Tang, Fenghe, et autres
Publié: (2025)
par: Tang, Fenghe, et autres
Publié: (2025)
MIPHEI-ViT: Multiplex Immunofluorescence Prediction from H&E Images using ViT Foundation Models
par: Balezo, Guillaume, et autres
Publié: (2025)
par: Balezo, Guillaume, et autres
Publié: (2025)
RepViT: Revisiting Mobile CNN From ViT Perspective
par: Wang, Ao, et autres
Publié: (2023)
par: Wang, Ao, et autres
Publié: (2023)
Refining Datapath for Microscaling ViTs
par: Xiao, Can, et autres
Publié: (2025)
par: Xiao, Can, et autres
Publié: (2025)
Purrturbed but Stable: Human-Cat Invariant Representations Across CNNs, ViTs and Self-Supervised ViTs
par: Shah, Arya, et autres
Publié: (2025)
par: Shah, Arya, et autres
Publié: (2025)
Multimodal Pathway: Improve Transformers with Irrelevant Data from Other Modalities
par: Zhang, Yiyuan, et autres
Publié: (2024)
par: Zhang, Yiyuan, et autres
Publié: (2024)
ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation
par: Li, Siyou, et autres
Publié: (2024)
par: Li, Siyou, et autres
Publié: (2024)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
Pneumonia Image Classification Based on Lightweight Mobile ViT Networks
par: Zhiqiang Zheng, et autres
Publié: (2025)
par: Zhiqiang Zheng, et autres
Publié: (2025)
Post-Disaster Affected Area Segmentation with a Vision Transformer (ViT)-based EVAP Model using Sentinel-2 and Formosat-5 Imagery
par: Chu, Yi-Shan, et autres
Publié: (2025)
par: Chu, Yi-Shan, et autres
Publié: (2025)
OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation
par: Song, Yiren, et autres
Publié: (2026)
par: Song, Yiren, et autres
Publié: (2026)
OmniLens++: Blind Lens Aberration Correction via Large LensLib Pre-Training and Latent PSF Representation
par: Jiang, Qi, et autres
Publié: (2025)
par: Jiang, Qi, et autres
Publié: (2025)
U-REPA: Aligning Diffusion U-Nets to ViTs
par: Tian, Yuchuan, et autres
Publié: (2025)
par: Tian, Yuchuan, et autres
Publié: (2025)
ViT-EnsembleAttack: Augmenting Ensemble Models for Stronger Adversarial Transferability in Vision Transformers
par: Cao, Hanwen, et autres
Publié: (2025)
par: Cao, Hanwen, et autres
Publié: (2025)
D-AR: Diffusion via Autoregressive Models
par: Gao, Ziteng, et autres
Publié: (2025)
par: Gao, Ziteng, et autres
Publié: (2025)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
Rethinking Random Masking in Self-Distillation on ViT
par: Seong, Jihyeon, et autres
Publié: (2025)
par: Seong, Jihyeon, et autres
Publié: (2025)
Documents similaires
-
ViT-Lens: Towards Omni-modal Representations
par: Lei, Weixian, et autres
Publié: (2023) -
Let ViT Speak: Generative Language-Image Pre-training
par: Fang, Yan, et autres
Publié: (2026) -
ViT Registers and Fractal ViT
par: Chou, Jason Chuan-Chih, et autres
Publié: (2026) -
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
par: Kim, Ye-eun, et autres
Publié: (2025) -
OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
par: Song, Yiren, et autres
Publié: (2025)