Orient Anything V2: Unifying Orientation and Rotation Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zehan, Zhang, Ziang, Xu, Jiayang, Wang, Jialei, Pang, Tianyu, Du, Chao, Zhao, HengShuang, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Depth Anything with Any Prior
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024)
par: Liu, Luping, et autres
Publié: (2024)
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
par: Zhou, Junbao, et autres
Publié: (2025)
par: Zhou, Junbao, et autres
Publié: (2025)
DSI-Bench: A Benchmark for Dynamic Spatial Intelligence
par: Zhang, Ziang, et autres
Publié: (2025)
par: Zhang, Ziang, et autres
Publié: (2025)
Depth Anything V2
par: Yang, Lihe, et autres
Publié: (2024)
par: Yang, Lihe, et autres
Publié: (2024)
Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM
par: Huang, Haifeng, et autres
Publié: (2026)
par: Huang, Haifeng, et autres
Publié: (2026)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
RQFormer: Rotated Query Transformer for End-to-End Oriented Object Detection
par: Zhao, Jiaqi, et autres
Publié: (2023)
par: Zhao, Jiaqi, et autres
Publié: (2023)
ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks
par: Xu, Jiayang, et autres
Publié: (2026)
par: Xu, Jiayang, et autres
Publié: (2026)
MESA: Matching Everything by Segmenting Anything
par: Zhang, Yesheng, et autres
Publié: (2024)
par: Zhang, Yesheng, et autres
Publié: (2024)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
par: Schneider, Benjamin, et autres
Publié: (2025)
par: Schneider, Benjamin, et autres
Publié: (2025)
Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models
par: Wang, Kaishen, et autres
Publié: (2026)
par: Wang, Kaishen, et autres
Publié: (2026)
SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
par: Zhang, Jiacheng, et autres
Publié: (2026)
par: Zhang, Jiacheng, et autres
Publié: (2026)
PointSAM: Pointly-Supervised Segment Anything Model for Remote Sensing Images
par: Liu, Nanqing, et autres
Publié: (2024)
par: Liu, Nanqing, et autres
Publié: (2024)
Describe Anything in Medical Images
par: Xiao, Xi, et autres
Publié: (2025)
par: Xiao, Xi, et autres
Publié: (2025)
OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic Segmentation
par: Zhong, Ding, et autres
Publié: (2025)
par: Zhong, Ding, et autres
Publié: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
par: Huang, Haifeng, et autres
Publié: (2023)
par: Huang, Haifeng, et autres
Publié: (2023)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025)
par: Hong, Minjie, et autres
Publié: (2025)
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Du, Henghui, et autres
Publié: (2025)
par: Du, Henghui, et autres
Publié: (2025)
MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos
par: Gong, Kehong, et autres
Publié: (2025)
par: Gong, Kehong, et autres
Publié: (2025)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
Stereo Anything: Unifying Zero-shot Stereo Matching with Large-Scale Mixed Data
par: Guo, Xianda, et autres
Publié: (2024)
par: Guo, Xianda, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
Prompting Segment Anything Model with Domain-Adaptive Prototype for Generalizable Medical Image Segmentation
par: Wei, Zhikai, et autres
Publié: (2024)
par: Wei, Zhikai, et autres
Publié: (2024)
RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding
par: Xu, Linrui, et autres
Publié: (2024)
par: Xu, Linrui, et autres
Publié: (2024)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
par: Huang, Haifeng, et autres
Publié: (2025)
par: Huang, Haifeng, et autres
Publié: (2025)
UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
par: Zhang, Ruiheng, et autres
Publié: (2026)
par: Zhang, Ruiheng, et autres
Publié: (2026)
GRA: Detecting Oriented Objects through Group-wise Rotating and Attention
par: Wang, Jiangshan, et autres
Publié: (2024)
par: Wang, Jiangshan, et autres
Publié: (2024)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
par: Zhao, Shanshan, et autres
Publié: (2025)
par: Zhao, Shanshan, et autres
Publié: (2025)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
par: Zhao, Rui, et autres
Publié: (2025)
par: Zhao, Rui, et autres
Publié: (2025)
Training for Identity, Inference for Controllability: A Unified Approach to Tuning-Free Face Personalization
par: Pang, Lianyu, et autres
Publié: (2025)
par: Pang, Lianyu, et autres
Publié: (2025)
OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution
par: Xia, Chong, et autres
Publié: (2026)
par: Xia, Chong, et autres
Publié: (2026)
Contour Field based Elliptical Shape Prior for the Segment Anything Model
par: Zhao, Xinyu, et autres
Publié: (2025)
par: Zhao, Xinyu, et autres
Publié: (2025)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
par: Li, Zecheng, et autres
Publié: (2025)
par: Li, Zecheng, et autres
Publié: (2025)
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
FastDrag: Manipulate Anything in One Step
par: Zhao, Xuanjia, et autres
Publié: (2024)
par: Zhao, Xuanjia, et autres
Publié: (2024)
Count Anything
par: Lei, Mengqi, et autres
Publié: (2026)
par: Lei, Mengqi, et autres
Publié: (2026)
Documents similaires
-
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
par: Wang, Zehan, et autres
Publié: (2024) -
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025) -
Depth Anything with Any Prior
par: Wang, Zehan, et autres
Publié: (2025) -
Improving Long-Text Alignment for Text-to-Image Diffusion Models
par: Liu, Luping, et autres
Publié: (2024) -
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
par: Zhou, Junbao, et autres
Publié: (2025)