Sparse Laneformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Ji, Zhang, Zifeng, Lu, Mingjie, Wei, Hongyang, Li, Dong, Xie, Yile, Peng, Jinzhang, Tian, Lu, Sirasao, Ashish, Barsoum, Emad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fast Occupancy Network
di: Lu, Mingjie, et al.
Pubblicazione: (2024)
di: Lu, Mingjie, et al.
Pubblicazione: (2024)
EGSRAL: An Enhanced 3D Gaussian Splatting based Renderer with Automated Labeling for Large-Scale Driving Scene
di: Huo, Yixiong, et al.
Pubblicazione: (2024)
di: Huo, Yixiong, et al.
Pubblicazione: (2024)
DiP-GO: A Diffusion Pruner via Few-step Gradient Optimization
di: Zhu, Haowei, et al.
Pubblicazione: (2024)
di: Zhu, Haowei, et al.
Pubblicazione: (2024)
Partial Convolution Meets Visual Attention
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
UPDP: A Unified Progressive Depth Pruner for CNN and Vision Transformer
di: Liu, Ji, et al.
Pubblicazione: (2024)
di: Liu, Ji, et al.
Pubblicazione: (2024)
MonoGS++: Fast and Accurate Monocular RGB Gaussian SLAM
di: Li, Renwu, et al.
Pubblicazione: (2025)
di: Li, Renwu, et al.
Pubblicazione: (2025)
LADDER: An Efficient Framework for Video Frame Interpolation
di: Shen, Tong, et al.
Pubblicazione: (2024)
di: Shen, Tong, et al.
Pubblicazione: (2024)
Towards Scale-Aware Full Surround Monodepth with Transformers
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
di: Yang, Yuchen, et al.
Pubblicazione: (2024)
DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity
di: Zhu, Haowei, et al.
Pubblicazione: (2026)
di: Zhu, Haowei, et al.
Pubblicazione: (2026)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
di: Ke, Wenjin, et al.
Pubblicazione: (2025)
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
di: Shen, Tong, et al.
Pubblicazione: (2025)
di: Shen, Tong, et al.
Pubblicazione: (2025)
AMD-Hummingbird: Towards an Efficient Text-to-Video Model
di: Isobe, Takashi, et al.
Pubblicazione: (2025)
di: Isobe, Takashi, et al.
Pubblicazione: (2025)
Taming Diffusion Prior for Image Super-Resolution with Domain Shift SDEs
di: Cui, Qinpeng, et al.
Pubblicazione: (2024)
di: Cui, Qinpeng, et al.
Pubblicazione: (2024)
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
di: Huang, Zhi-Lin, et al.
Pubblicazione: (2025)
di: Huang, Zhi-Lin, et al.
Pubblicazione: (2025)
ReNeg: Learning Negative Embedding with Reward Guidance
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
di: Ge, Mengmeng, et al.
Pubblicazione: (2026)
di: Ge, Mengmeng, et al.
Pubblicazione: (2026)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
Sparse-Up: Learnable Sparse Upsampling for 3D Generation with High-Fidelity Textures
di: Xiao, Lu, et al.
Pubblicazione: (2025)
di: Xiao, Lu, et al.
Pubblicazione: (2025)
DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation
di: jiao, Jiajun, et al.
Pubblicazione: (2026)
di: jiao, Jiajun, et al.
Pubblicazione: (2026)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
di: Huang, Haiduo, et al.
Pubblicazione: (2025)
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
di: Singh, Shivam, et al.
Pubblicazione: (2026)
di: Singh, Shivam, et al.
Pubblicazione: (2026)
CaptionQA: Is Your Caption as Useful as the Image Itself?
di: Yang, Shijia, et al.
Pubblicazione: (2025)
di: Yang, Shijia, et al.
Pubblicazione: (2025)
SparseFusion: Efficient Sparse Multi-Modal Fusion Framework for Long-Range 3D Perception
di: Li, Yiheng, et al.
Pubblicazione: (2024)
di: Li, Yiheng, et al.
Pubblicazione: (2024)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
di: Li, Guanchen, et al.
Pubblicazione: (2024)
di: Li, Guanchen, et al.
Pubblicazione: (2024)
TAPM-Net: Trajectory-Aware Perturbation Modeling for Infrared Small Target Detection
di: Xie, Hongyang, et al.
Pubblicazione: (2026)
di: Xie, Hongyang, et al.
Pubblicazione: (2026)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2026)
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2026)
ACMo: Attribute Controllable Motion Generation
di: Wei, Mingjie, et al.
Pubblicazione: (2025)
di: Wei, Mingjie, et al.
Pubblicazione: (2025)
Reason-Then-Retrieve for CoVR-R with Structured Edit Prompts and Dense-Sparse Fusion
di: Liu, DongQing, et al.
Pubblicazione: (2026)
di: Liu, DongQing, et al.
Pubblicazione: (2026)
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Exploring Sparse Visual Prompt for Domain Adaptive Dense Prediction
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
di: Yang, Senqiao, et al.
Pubblicazione: (2023)
Fully Sparse 3D Occupancy Prediction
di: Liu, Haisong, et al.
Pubblicazione: (2023)
di: Liu, Haisong, et al.
Pubblicazione: (2023)
SAMSON: 3rd Place Solution of LSVOS 2025 VOS Challenge
di: Xie, Yujie, et al.
Pubblicazione: (2025)
di: Xie, Yujie, et al.
Pubblicazione: (2025)
Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
di: Wang, Ze, et al.
Pubblicazione: (2025)
di: Wang, Ze, et al.
Pubblicazione: (2025)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
di: Guo, Yuxiang, et al.
Pubblicazione: (2025)
di: Guo, Yuxiang, et al.
Pubblicazione: (2025)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
Learning Pyramid-structured Long-range Dependencies for 3D Human Pose Estimation
di: Wei, Mingjie, et al.
Pubblicazione: (2025)
di: Wei, Mingjie, et al.
Pubblicazione: (2025)
Stereo-Inertial Poser: Towards Metric-Accurate Shape-Aware Motion Capture Using Sparse IMUs and a Single Stereo Camera
di: Tang, Tutian, et al.
Pubblicazione: (2026)
di: Tang, Tutian, et al.
Pubblicazione: (2026)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
di: Zheng, Zirui, et al.
Pubblicazione: (2025)
Teaching CORnet Human fMRI Representations for Enhanced Model-Brain Alignment
di: Lu, Zitong, et al.
Pubblicazione: (2024)
di: Lu, Zitong, et al.
Pubblicazione: (2024)
Latent Visual Reasoning
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Fast Occupancy Network
di: Lu, Mingjie, et al.
Pubblicazione: (2024) -
EGSRAL: An Enhanced 3D Gaussian Splatting based Renderer with Automated Labeling for Large-Scale Driving Scene
di: Huo, Yixiong, et al.
Pubblicazione: (2024) -
DiP-GO: A Diffusion Pruner via Few-step Gradient Optimization
di: Zhu, Haowei, et al.
Pubblicazione: (2024) -
Partial Convolution Meets Visual Attention
di: Huang, Haiduo, et al.
Pubblicazione: (2025) -
UPDP: A Unified Progressive Depth Pruner for CNN and Vision Transformer
di: Liu, Ji, et al.
Pubblicazione: (2024)