UniQ: Unified Decoder with Task-specific Queries for Efficient Scene Graph Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Liao, Xinyao, Wei, Wei, Chen, Dangyang, Fu, Yuanyuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
por: Liao, Xinyao, et al.
Publicado: (2025)
por: Liao, Xinyao, et al.
Publicado: (2025)
Decoding the Surgical Scene: A Scoping Review of Scene Graphs in Surgery
por: Henriques, Angelo, et al.
Publicado: (2025)
por: Henriques, Angelo, et al.
Publicado: (2025)
ROSGS: Relightable Outdoor Scenes With Gaussian Splatting
por: Liao, Lianjun, et al.
Publicado: (2025)
por: Liao, Lianjun, et al.
Publicado: (2025)
SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model
por: Li, Xinqing, et al.
Publicado: (2025)
por: Li, Xinqing, et al.
Publicado: (2025)
Textual and Visual Guided Task Adaptation for Source-Free Cross-Domain Few-Shot Segmentation
por: Liu, Jianming, et al.
Publicado: (2025)
por: Liu, Jianming, et al.
Publicado: (2025)
A Reverse Causal Framework to Mitigate Spurious Correlations for Debiasing Scene Graph Generation
por: Sun, Shuzhou, et al.
Publicado: (2025)
por: Sun, Shuzhou, et al.
Publicado: (2025)
Breaking the Resource Wall: Geometry-Guided Sequence Modeling for Efficient Semantic Segmentation
por: Chan, Sheng-Wei, et al.
Publicado: (2026)
por: Chan, Sheng-Wei, et al.
Publicado: (2026)
FoR-Net: Learning to Focus on Hard Regions for Efficient Semantic Segmentation
por: Chan, Sheng-Wei, et al.
Publicado: (2026)
por: Chan, Sheng-Wei, et al.
Publicado: (2026)
LEGO: LoRA-Enabled Generator-Oriented Framework for Synthetic Image Detection
por: Xiao, Yutong, et al.
Publicado: (2026)
por: Xiao, Yutong, et al.
Publicado: (2026)
FlowIBR: Leveraging Pre-Training for Efficient Neural Image-Based Rendering of Dynamic Scenes
por: Büsching, Marcel, et al.
Publicado: (2023)
por: Büsching, Marcel, et al.
Publicado: (2023)
ViG-LRGC: Vision Graph Neural Networks with Learnable Reparameterized Graph Construction
por: Elsharkawi, Ismael, et al.
Publicado: (2025)
por: Elsharkawi, Ismael, et al.
Publicado: (2025)
U-Net-Like Spiking Neural Networks for Single Image Dehazing
por: Li, Huibin, et al.
Publicado: (2025)
por: Li, Huibin, et al.
Publicado: (2025)
ProtoFlow: Interpretable and Robust Surgical Workflow Modeling with Learned Dynamic Scene Graph Prototypes
por: Holm, Felix, et al.
Publicado: (2025)
por: Holm, Felix, et al.
Publicado: (2025)
ERNet: Efficient Non-Rigid Registration Network for Point Sequences
por: He, Guangzhao, et al.
Publicado: (2025)
por: He, Guangzhao, et al.
Publicado: (2025)
BlindSight: Harnessing Sparsity for Efficient Vision-Language Models
por: Srikrishnan, Tharun Adithya, et al.
Publicado: (2025)
por: Srikrishnan, Tharun Adithya, et al.
Publicado: (2025)
RGB-Only Gaussian Splatting SLAM for Unbounded Outdoor Scenes
por: Yu, Sicheng, et al.
Publicado: (2025)
por: Yu, Sicheng, et al.
Publicado: (2025)
vS-Graphs: Tightly Coupling Visual SLAM and 3D Scene Graphs Exploiting Hierarchical Scene Understanding
por: Tourani, Ali, et al.
Publicado: (2025)
por: Tourani, Ali, et al.
Publicado: (2025)
One Leaf Reveals the Season: Occlusion-Based Contrastive Learning with Semantic-Aware Views for Efficient Visual Representation
por: Yang, Xiaoyu, et al.
Publicado: (2024)
por: Yang, Xiaoyu, et al.
Publicado: (2024)
A Vision-Language Model for Focal Liver Lesion Classification
por: Jian, Song, et al.
Publicado: (2025)
por: Jian, Song, et al.
Publicado: (2025)
ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing
por: Bucher, Martin JJ., et al.
Publicado: (2025)
por: Bucher, Martin JJ., et al.
Publicado: (2025)
Extrapolating and Decoupling Image-to-Video Generation Models: Motion Modeling is Easier Than You Think
por: Tian, Jie, et al.
Publicado: (2025)
por: Tian, Jie, et al.
Publicado: (2025)
LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding
por: Wang, Fusang, et al.
Publicado: (2026)
por: Wang, Fusang, et al.
Publicado: (2026)
Context-Aware Indoor Point Cloud Object Generation through User Instructions
por: Luo, Yiyang, et al.
Publicado: (2023)
por: Luo, Yiyang, et al.
Publicado: (2023)
SemanticHuman-HD: High-Resolution Semantic Disentangled 3D Human Generation
por: Zheng, Peng, et al.
Publicado: (2024)
por: Zheng, Peng, et al.
Publicado: (2024)
Co-Speech Gesture and Facial Expression Generation for Non-Photorealistic 3D Characters
por: Omine, Taisei, et al.
Publicado: (2025)
por: Omine, Taisei, et al.
Publicado: (2025)
MeshPose: Unifying DensePose and 3D Body Mesh reconstruction
por: Lê, Eric-Tuan, et al.
Publicado: (2024)
por: Lê, Eric-Tuan, et al.
Publicado: (2024)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
por: Chen, Zhangquan, et al.
Publicado: (2026)
por: Chen, Zhangquan, et al.
Publicado: (2026)
Voxel Scene Graph for Intracranial Hemorrhage
por: Sanner, Antoine P., et al.
Publicado: (2024)
por: Sanner, Antoine P., et al.
Publicado: (2024)
VisRL: Intention-Driven Visual Perception via Reinforced Reasoning
por: Chen, Zhangquan, et al.
Publicado: (2025)
por: Chen, Zhangquan, et al.
Publicado: (2025)
Cross-Modal Transfer from Memes to Videos: Addressing Data Scarcity in Hateful Video Detection
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
por: Satish, Siddarth Nilol Kundur, et al.
Publicado: (2026)
por: Satish, Siddarth Nilol Kundur, et al.
Publicado: (2026)
Category-Agnostic Neural Object Rigging
por: He, Guangzhao, et al.
Publicado: (2025)
por: He, Guangzhao, et al.
Publicado: (2025)
Exploring Surround-View Fisheye Camera 3D Object Detection
por: Li, Changcai, et al.
Publicado: (2025)
por: Li, Changcai, et al.
Publicado: (2025)
4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding
por: Chen, Zhangquan, et al.
Publicado: (2026)
por: Chen, Zhangquan, et al.
Publicado: (2026)
M3CAD: Towards Generic Cooperative Autonomous Driving Benchmark
por: Zhu, Morui, et al.
Publicado: (2025)
por: Zhu, Morui, et al.
Publicado: (2025)
A Challenging Benchmark of Anime Style Recognition
por: Li, Haotang, et al.
Publicado: (2022)
por: Li, Haotang, et al.
Publicado: (2022)
OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection
por: Schneider, David, et al.
Publicado: (2025)
por: Schneider, David, et al.
Publicado: (2025)
Unified Auto-Encoding with Masked Diffusion
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024)
por: Hansen-Estruch, Philippe, et al.
Publicado: (2024)
ReLKD: Inter-Class Relation Learning with Knowledge Distillation for Generalized Category Discovery
por: Zhou, Fang, et al.
Publicado: (2025)
por: Zhou, Fang, et al.
Publicado: (2025)
StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation
por: Oliveira, Daniel A. P., et al.
Publicado: (2025)
por: Oliveira, Daniel A. P., et al.
Publicado: (2025)
Ejemplares similares
-
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
por: Liao, Xinyao, et al.
Publicado: (2025) -
Decoding the Surgical Scene: A Scoping Review of Scene Graphs in Surgery
por: Henriques, Angelo, et al.
Publicado: (2025) -
ROSGS: Relightable Outdoor Scenes With Gaussian Splatting
por: Liao, Lianjun, et al.
Publicado: (2025) -
SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model
por: Li, Xinqing, et al.
Publicado: (2025) -
Textual and Visual Guided Task Adaptation for Source-Free Cross-Domain Few-Shot Segmentation
por: Liu, Jianming, et al.
Publicado: (2025)