Text2Place: Affordance-aware Text Guided Human Placement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Parihar, Rishubh, Gupta, Harsh, VS, Sachidanand, Babu, R. Venkatesh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
par: Parihar, Rishubh, et autres
Publié: (2024)
par: Parihar, Rishubh, et autres
Publié: (2024)
MonoPlace3D: Learning 3D-Aware Object Placement for 3D Monocular Detection
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
par: Agrawal, Vaibhav, et autres
Publié: (2026)
par: Agrawal, Vaibhav, et autres
Publié: (2026)
Balancing Act: Distribution-Guided Debiasing in Diffusion Models
par: Parihar, Rishubh, et autres
Publié: (2024)
par: Parihar, Rishubh, et autres
Publié: (2024)
Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections
par: Dhiman, Ankit, et autres
Publié: (2024)
par: Dhiman, Ankit, et autres
Publié: (2024)
Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing
par: Parihar, Rishubh, et autres
Publié: (2025)
par: Parihar, Rishubh, et autres
Publié: (2025)
GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models
par: Basu, Abhipsa, et autres
Publié: (2026)
par: Basu, Abhipsa, et autres
Publié: (2026)
DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
par: Babu, Nithin C., et autres
Publié: (2025)
par: Babu, Nithin C., et autres
Publié: (2025)
OLAF: A Plug-and-Play Framework for Enhanced Multi-object Multi-part Scene Parsing
par: Gupta, Pranav, et autres
Publié: (2024)
par: Gupta, Pranav, et autres
Publié: (2024)
Robustness Analysis on Foundational Segmentation Models
par: Schiappa, Madeline Chantry, et autres
Publié: (2023)
par: Schiappa, Madeline Chantry, et autres
Publié: (2023)
Harnessing Diffusion-Generated Synthetic Images for Fair Image Classification
par: Basu, Abhipsa, et autres
Publié: (2025)
par: Basu, Abhipsa, et autres
Publié: (2025)
TextInPlace: Indoor Visual Place Recognition in Repetitive Structures with Scene Text Spotting and Verification
par: Tao, Huaqi, et autres
Publié: (2025)
par: Tao, Huaqi, et autres
Publié: (2025)
LocInv: Localization-aware Inversion for Text-Guided Image Editing
par: Tang, Chuanming, et autres
Publié: (2024)
par: Tang, Chuanming, et autres
Publié: (2024)
HRP: Human Affordances for Robotic Pre-Training
par: Srirama, Mohan Kumar, et autres
Publié: (2024)
par: Srirama, Mohan Kumar, et autres
Publié: (2024)
Automatic Text Box Placement for Supporting Typographic Design
par: Muraoka, Jun, et autres
Publié: (2025)
par: Muraoka, Jun, et autres
Publié: (2025)
Text-driven Affordance Learning from Egocentric Vision
par: Yoshida, Tomoya, et autres
Publié: (2024)
par: Yoshida, Tomoya, et autres
Publié: (2024)
Leveraging Text Localization for Scene Text Removal via Text-aware Masked Image Modeling
par: Wang, Zixiao, et autres
Publié: (2024)
par: Wang, Zixiao, et autres
Publié: (2024)
TextIM: Part-aware Interactive Motion Synthesis from Text
par: Fan, Siyuan, et autres
Publié: (2024)
par: Fan, Siyuan, et autres
Publié: (2024)
MSSPlace: Multi-Sensor Place Recognition with Visual and Text Semantics
par: Melekhin, Alexander, et autres
Publié: (2024)
par: Melekhin, Alexander, et autres
Publié: (2024)
Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition
par: Shang, Tianyi, et autres
Publié: (2026)
par: Shang, Tianyi, et autres
Publié: (2026)
Do Vision Language Models Need to Process Image Tokens?
par: Ghosh, Sambit, et autres
Publié: (2026)
par: Ghosh, Sambit, et autres
Publié: (2026)
MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World
par: Dhiman, Ankit, et autres
Publié: (2025)
par: Dhiman, Ankit, et autres
Publié: (2025)
IndicSTR12: A Dataset for Indic Scene Text Recognition
par: Lunia, Harsh, et autres
Publié: (2024)
par: Lunia, Harsh, et autres
Publié: (2024)
INTRA: Interaction Relationship-aware Weakly Supervised Affordance Grounding
par: Jang, Ji Ha, et autres
Publié: (2024)
par: Jang, Ji Ha, et autres
Publié: (2024)
Informative Text-Image Alignment for Visual Affordance Learning with Foundation Models
par: Zhang, Qian, et autres
Publié: (2025)
par: Zhang, Qian, et autres
Publié: (2025)
TIPS: Text-Image Pretraining with Spatial awareness
par: Maninis, Kevis-Kokitsi, et autres
Publié: (2024)
par: Maninis, Kevis-Kokitsi, et autres
Publié: (2024)
Certainty and Uncertainty Guided Active Domain Adaptation
par: Safaei, Bardia, et autres
Publié: (2025)
par: Safaei, Bardia, et autres
Publié: (2025)
Everything in Its Place: Benchmarking Spatial Intelligence of Text-to-Image Models
par: Wang, Zengbin, et autres
Publié: (2026)
par: Wang, Zengbin, et autres
Publié: (2026)
Embedding Arithmetic: A Lightweight, Tuning-Free Framework for Post-hoc Bias Mitigation in Text-to-Image Models
par: Sambandham, Venkatesh Thirugnana, et autres
Publié: (2026)
par: Sambandham, Venkatesh Thirugnana, et autres
Publié: (2026)
TextCenGen: Attention-Guided Text-Centric Background Adaptation for Text-to-Image Generation
par: Liang, Tianyi, et autres
Publié: (2024)
par: Liang, Tianyi, et autres
Publié: (2024)
MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms
par: Shang, Tianyi, et autres
Publié: (2024)
par: Shang, Tianyi, et autres
Publié: (2024)
Composing Parts for Expressive Object Generation
par: Rangwani, Harsh, et autres
Publié: (2024)
par: Rangwani, Harsh, et autres
Publié: (2024)
Text Embedding Knows How to Quantize Text-Guided Diffusion Models
par: Lee, Hongjae, et autres
Publié: (2025)
par: Lee, Hongjae, et autres
Publié: (2025)
Text2Graph VPR: A Text-to-Graph Expert System for Explainable Place Recognition in Changing Environments
par: Yousefzadeh, Saeideh, et autres
Publié: (2025)
par: Yousefzadeh, Saeideh, et autres
Publié: (2025)
Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code Generation
par: Wu, Guangyang, et autres
Publié: (2024)
par: Wu, Guangyang, et autres
Publié: (2024)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
par: Shang, Tianyi, et autres
Publié: (2025)
par: Shang, Tianyi, et autres
Publié: (2025)
T3M: Text Guided 3D Human Motion Synthesis from Speech
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents
par: Huang-Menders, Alexander, et autres
Publié: (2025)
par: Huang-Menders, Alexander, et autres
Publié: (2025)
TextOVSR: Text-Guided Real-World Opera Video Super-Resolution
par: Chang, Hua, et autres
Publié: (2026)
par: Chang, Hua, et autres
Publié: (2026)
Documents similaires
-
Compass Control: Multi Object Orientation Control for Text-to-Image Generation
par: Parihar, Rishubh, et autres
Publié: (2025) -
PreciseControl: Enhancing Text-To-Image Diffusion Models with Fine-Grained Attribute Control
par: Parihar, Rishubh, et autres
Publié: (2024) -
MonoPlace3D: Learning 3D-Aware Object Placement for 3D Monocular Detection
par: Parihar, Rishubh, et autres
Publié: (2025) -
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
par: Agrawal, Vaibhav, et autres
Publié: (2026) -
Balancing Act: Distribution-Guided Debiasing in Diffusion Models
par: Parihar, Rishubh, et autres
Publié: (2024)