SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Agrawal, Vaibhav, Parihar, Rishubh, Bhat, Pradhaan, Sarvadevabhatla, Ravi Kiran, Babu, R. Venkatesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
MonoPlace3D: Learning 3D-Aware Object Placement for 3D Monocular Detection
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
par: Parihar, Rishubh, et autres
Publié: (2024)
par: Parihar, Rishubh, et autres
Publié: (2024)
Text2Place: Affordance-aware Text Guided Human Placement
par: Parihar, Rishubh, et autres
Publié: (2024)
par: Parihar, Rishubh, et autres
Publié: (2024)
RoadTones: Tone Controllable Text Generation from Road Event Videos
par: Parikh, Chirag, et autres
Publié: (2026)
par: Parikh, Chirag, et autres
Publié: (2026)
Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
Balancing Act: Distribution-Guided Debiasing in Diffusion Models
par: Parihar, Rishubh, et autres
Publié: (2024)
par: Parihar, Rishubh, et autres
Publié: (2024)
Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections
par: Dhiman, Ankit, et autres
Publié: (2024)
par: Dhiman, Ankit, et autres
Publié: (2024)
OLAF: A Plug-and-Play Framework for Enhanced Multi-object Multi-part Scene Parsing
par: Gupta, Pranav, et autres
Publié: (2024)
par: Gupta, Pranav, et autres
Publié: (2024)
TexTAR : Textual Attribute Recognition in Multi-domain and Multi-lingual Document Images
par: Kumar, Rohan, et autres
Publié: (2025)
par: Kumar, Rohan, et autres
Publié: (2025)
MoRAG -- Multi-Fusion Retrieval Augmented Generation for Human Motion
par: Kalakonda, Sai Shashank, et autres
Publié: (2024)
par: Kalakonda, Sai Shashank, et autres
Publié: (2024)
Unveiling Text in Challenging Stone Inscriptions: A Character-Context-Aware Patching Strategy for Binarization
par: Jena, Pratyush, et autres
Publié: (2026)
par: Jena, Pratyush, et autres
Publié: (2026)
STRinGS: Selective Text Refinement in Gaussian Splatting
par: Raundhal, Abhinav, et autres
Publié: (2025)
par: Raundhal, Abhinav, et autres
Publié: (2025)
Transfer-LMR: Heavy-Tail Driving Behavior Recognition in Diverse Traffic Scenarios
par: Parikh, Chirag, et autres
Publié: (2024)
par: Parikh, Chirag, et autres
Publié: (2024)
DashCop: Automated E-ticket Generation for Two-Wheeler Traffic Violations Using Dashcam Videos
par: Rawat, Deepti, et autres
Publié: (2025)
par: Rawat, Deepti, et autres
Publié: (2025)
Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification
par: Basu, Abhipsa, et autres
Publié: (2025)
par: Basu, Abhipsa, et autres
Publié: (2025)
IndicDLP: A Foundational Dataset for Multi-Lingual and Multi-Domain Document Layout Parsing
par: Nath, Oikantik, et autres
Publié: (2025)
par: Nath, Oikantik, et autres
Publié: (2025)
Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints
par: Zhang, Chenyangguang, et autres
Publié: (2026)
par: Zhang, Chenyangguang, et autres
Publié: (2026)
OAHuman: Occlusion-Aware 3D Human Reconstruction from Monocular Images
par: Yang, Yuanwang, et autres
Publié: (2026)
par: Yang, Yuanwang, et autres
Publié: (2026)
RoadSocial: A Diverse VideoQA Dataset and Benchmark for Road Event Understanding from Social Video Narratives
par: Parikh, Chirag, et autres
Publié: (2025)
par: Parikh, Chirag, et autres
Publié: (2025)
Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models
par: Ho, Nhan, et autres
Publié: (2026)
par: Ho, Nhan, et autres
Publié: (2026)
IDD-X: A Multi-View Dataset for Ego-relative Important Object Localization and Explanation in Dense and Unstructured Traffic
par: Parikh, Chirag, et autres
Publié: (2024)
par: Parikh, Chirag, et autres
Publié: (2024)
Occlusion-Aware 3D Motion Interpretation for Abnormal Behavior Detection
par: Li, Su, et autres
Publié: (2024)
par: Li, Su, et autres
Publié: (2024)
Occlusion-aware Text-Image-Point Cloud Pretraining for Open-World 3D Object Recognition
par: Nguyen, Khanh, et autres
Publié: (2025)
par: Nguyen, Khanh, et autres
Publié: (2025)
Text-Image Conditioned 3D Generation
par: Cen, Jiazhong, et autres
Publié: (2026)
par: Cen, Jiazhong, et autres
Publié: (2026)
Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
par: Dodds, Laura, et autres
Publié: (2025)
par: Dodds, Laura, et autres
Publié: (2025)
DreamControl: Control-Based Text-to-3D Generation with 3D Self-Prior
par: Huang, Tianyu, et autres
Publié: (2023)
par: Huang, Tianyu, et autres
Publié: (2023)
DehazeGS: Seeing Through Fog with 3D Gaussian Splatting
par: Yu, Jinze, et autres
Publié: (2025)
par: Yu, Jinze, et autres
Publié: (2025)
Lookalike3D: Seeing Double in 3D
par: Yeshwanth, Chandan, et autres
Publié: (2026)
par: Yeshwanth, Chandan, et autres
Publié: (2026)
Occlusion-Aware 3D Hand-Object Pose Estimation with Masked AutoEncoders
par: Yang, Hui, et autres
Publié: (2025)
par: Yang, Hui, et autres
Publié: (2025)
Shoot-Bounce-3D: Single-Shot Occlusion-Aware 3D from Lidar by Decomposing Two-Bounce Light
par: Klinghoffer, Tzofi, et autres
Publié: (2025)
par: Klinghoffer, Tzofi, et autres
Publié: (2025)
PI3D: Efficient Text-to-3D Generation with Pseudo-Image Diffusion
par: Liu, Ying-Tian, et autres
Publié: (2023)
par: Liu, Ying-Tian, et autres
Publié: (2023)
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation
par: Wang, Qinghe, et autres
Publié: (2025)
par: Wang, Qinghe, et autres
Publié: (2025)
CrackUDA: Incremental Unsupervised Domain Adaptation for Improved Crack Segmentation in Civil Structures
par: Srivastava, Kushagra, et autres
Publié: (2024)
par: Srivastava, Kushagra, et autres
Publié: (2024)
DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision
par: Zou, Xiandong, et autres
Publié: (2025)
par: Zou, Xiandong, et autres
Publié: (2025)
UniC-Lift: Unified 3D Instance Segmentation via Contrastive Learning
par: Dhiman, Ankit, et autres
Publié: (2025)
par: Dhiman, Ankit, et autres
Publié: (2025)
SplatFont3D: Structure-Aware Text-to-3D Artistic Font Generation with Part-Level Style Control
par: Gan, Ji, et autres
Publié: (2025)
par: Gan, Ji, et autres
Publié: (2025)
Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator
par: Go, Hyojun, et autres
Publié: (2025)
par: Go, Hyojun, et autres
Publié: (2025)
Generalizing Single-View 3D Shape Retrieval to Occlusions and Unseen Objects
par: Wu, Qirui, et autres
Publié: (2023)
par: Wu, Qirui, et autres
Publié: (2023)
SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation
par: He, Ming, et autres
Publié: (2026)
par: He, Ming, et autres
Publié: (2026)
Documents similaires
-
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
par: Parihar, Rishubh, et autres
Publié: (2025) -
MonoPlace3D: Learning 3D-Aware Object Placement for 3D Monocular Detection
par: Parihar, Rishubh, et autres
Publié: (2025) -
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
par: Parihar, Rishubh, et autres
Publié: (2024) -
Text2Place: Affordance-aware Text Guided Human Placement
par: Parihar, Rishubh, et autres
Publié: (2024) -
RoadTones: Tone Controllable Text Generation from Road Event Videos
par: Parikh, Chirag, et autres
Publié: (2026)