HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Zhongyu, Lin, ZhiWei, Wang, Xinhao, Wang, Yongtao, Xing, Yun, Qi, Shengxiang, Dong, Nan, Yang, Ming-Hsuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving
by: Xia, Zhongyu, et al.
Published: (2025)
by: Xia, Zhongyu, et al.
Published: (2025)
PTQAT: A Hybrid Parameter-Efficient Quantization Algorithm for 3D Perception Tasks
by: Wang, Xinhao, et al.
Published: (2025)
by: Wang, Xinhao, et al.
Published: (2025)
BEV-MAE: Bird's Eye View Masked Autoencoders for Point Cloud Pre-training in Autonomous Driving Scenarios
by: Lin, Zhiwei, et al.
Published: (2022)
by: Lin, Zhiwei, et al.
Published: (2022)
RCBEVDet: Radar-camera Fusion in Bird's Eye View for 3D Object Detection
by: Lin, Zhiwei, et al.
Published: (2024)
by: Lin, Zhiwei, et al.
Published: (2024)
OpenAD: Open-World Autonomous Driving Benchmark for 3D Object Detection
by: Xia, Zhongyu, et al.
Published: (2024)
by: Xia, Zhongyu, et al.
Published: (2024)
InsFusion: Rethink Instance-level LiDAR-Camera Fusion for 3D Object Detection
by: Xia, Zhongyu, et al.
Published: (2025)
by: Xia, Zhongyu, et al.
Published: (2025)
KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System
by: Xia, Zhongyu, et al.
Published: (2025)
by: Xia, Zhongyu, et al.
Published: (2025)
Towards Efficient and Effective Multi-Camera Encoding for End-to-End Driving
by: Yang, Jiawei, et al.
Published: (2025)
by: Yang, Jiawei, et al.
Published: (2025)
AMELIA: A Family of Multi-task End-to-end Language Models for Argumentation
by: Savigny, Henri, et al.
Published: (2025)
by: Savigny, Henri, et al.
Published: (2025)
HeLoFusion: An Efficient and Scalable Encoder for Modeling Heterogeneous and Multi-Scale Interactions in Trajectory Prediction
by: Wei, Bingqing, et al.
Published: (2025)
by: Wei, Bingqing, et al.
Published: (2025)
R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection
by: Xia, Zhongyu, et al.
Published: (2026)
by: Xia, Zhongyu, et al.
Published: (2026)
METDrive: Multi-modal End-to-end Autonomous Driving with Temporal Guidance
by: Guo, Ziang, et al.
Published: (2024)
by: Guo, Ziang, et al.
Published: (2024)
MEBS: Multi-task End-to-end Bid Shading for Multi-slot Display Advertising
by: Gong, Zhen, et al.
Published: (2024)
by: Gong, Zhen, et al.
Published: (2024)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
by: Xia, Zhongyu, et al.
Published: (2026)
by: Xia, Zhongyu, et al.
Published: (2026)
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
by: Zhou, Xiaoyu, et al.
Published: (2025)
by: Zhou, Xiaoyu, et al.
Published: (2025)
Efficient Multi-Camera Tokenization with Triplanes for End-to-End Driving
by: Ivanovic, Boris, et al.
Published: (2025)
by: Ivanovic, Boris, et al.
Published: (2025)
Efficiently Disentangling CLIP for Multi-Object Perception
by: Rawlekar, Samyak, et al.
Published: (2025)
by: Rawlekar, Samyak, et al.
Published: (2025)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
by: Wang, Xinhao, et al.
Published: (2026)
by: Wang, Xinhao, et al.
Published: (2026)
TEOcc: Radar-camera Multi-modal Occupancy Prediction via Temporal Enhancement
by: Lin, Zhiwei, et al.
Published: (2024)
by: Lin, Zhiwei, et al.
Published: (2024)
Auto-Configured Networks for Multi-Scale Multi-Output Time-Series Forecasting
by: Zha, Yumeng, et al.
Published: (2026)
by: Zha, Yumeng, et al.
Published: (2026)
RobuRCDet: Enhancing Robustness of Radar-Camera Fusion in Bird's Eye View for 3D Object Detection
by: Yue, Jingtong, et al.
Published: (2025)
by: Yue, Jingtong, et al.
Published: (2025)
COMICS: End-to-end Bi-grained Contrastive Learning for Multi-face Forgery Detection
by: Zhang, Cong, et al.
Published: (2023)
by: Zhang, Cong, et al.
Published: (2023)
MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection
by: Zhao, Xiran, et al.
Published: (2026)
by: Zhao, Xiran, et al.
Published: (2026)
Multi-task Image Restoration Guided By Robust DINO Features
by: Lin, Xin, et al.
Published: (2023)
by: Lin, Xin, et al.
Published: (2023)
End-to-end Autonomous Vehicle Following System using Monocular Fisheye Camera
by: Zhang, Jiale, et al.
Published: (2025)
by: Zhang, Jiale, et al.
Published: (2025)
HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving
by: Xia, Zhongyu, et al.
Published: (2026)
by: Xia, Zhongyu, et al.
Published: (2026)
RCBEVDet++: Toward High-accuracy Radar-Camera Fusion 3D Perception Network
by: Lin, Zhiwei, et al.
Published: (2024)
by: Lin, Zhiwei, et al.
Published: (2024)
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control
by: Wang, Yukun, et al.
Published: (2026)
by: Wang, Yukun, et al.
Published: (2026)
FedHENet: A Frugal Federated Learning Framework for Heterogeneous Environments
by: Dopico-Castro, Alejandro, et al.
Published: (2026)
by: Dopico-Castro, Alejandro, et al.
Published: (2026)
Multi-task Learning for Heterogeneous Data via Integrating Shared and Task-Specific Encodings
by: Sui, Yang, et al.
Published: (2025)
by: Sui, Yang, et al.
Published: (2025)
DV-3DLane: End-to-end Multi-modal 3D Lane Detection with Dual-view Representation
by: Luo, Yueru, et al.
Published: (2024)
by: Luo, Yueru, et al.
Published: (2024)
MDDM: A Multi-view Discriminative Enhanced Diffusion-based Model for Speech Enhancement
by: Xu, Nan, et al.
Published: (2025)
by: Xu, Nan, et al.
Published: (2025)
Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras
by: Dunion, Mhairi, et al.
Published: (2024)
by: Dunion, Mhairi, et al.
Published: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
by: Wang, Jieyi, et al.
Published: (2026)
by: Wang, Jieyi, et al.
Published: (2026)
Multi-level Reliable Guidance for Unpaired Multi-view Clustering
by: Xin, Like, et al.
Published: (2024)
by: Xin, Like, et al.
Published: (2024)
SEMPose: A Single End-to-end Network for Multi-object Pose Estimation
by: Liu, Xin, et al.
Published: (2024)
by: Liu, Xin, et al.
Published: (2024)
ParkingE2E: Camera-based End-to-end Parking Network, from Images to Planning
by: Li, Changze, et al.
Published: (2024)
by: Li, Changze, et al.
Published: (2024)
Which Side Are You On? A Multi-task Dataset for End-to-End Argument Summarisation and Evaluation
by: Li, Hao, et al.
Published: (2024)
by: Li, Hao, et al.
Published: (2024)
X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving
by: Zheng, Chaoda, et al.
Published: (2026)
by: Zheng, Chaoda, et al.
Published: (2026)
Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention
by: Xu, Dejia, et al.
Published: (2024)
by: Xu, Dejia, et al.
Published: (2024)
Similar Items
-
HENet++: Hybrid Encoding and Multi-task Learning for 3D Perception and End-to-end Autonomous Driving
by: Xia, Zhongyu, et al.
Published: (2025) -
PTQAT: A Hybrid Parameter-Efficient Quantization Algorithm for 3D Perception Tasks
by: Wang, Xinhao, et al.
Published: (2025) -
BEV-MAE: Bird's Eye View Masked Autoencoders for Point Cloud Pre-training in Autonomous Driving Scenarios
by: Lin, Zhiwei, et al.
Published: (2022) -
RCBEVDet: Radar-camera Fusion in Bird's Eye View for 3D Object Detection
by: Lin, Zhiwei, et al.
Published: (2024) -
OpenAD: Open-World Autonomous Driving Benchmark for 3D Object Detection
by: Xia, Zhongyu, et al.
Published: (2024)