•Text-to-Image & Image-to-Text Multimodal Synthesis: Generates high-fidelity images from text and writes captions for images.
•Retrieval-Augmented Training Architecture: Uses retrieval mechanisms to improve generation quality with 5x less compute.
•Inpainting & Image Editing: Performs complex image editing, object insertion, and style transfer via text prompts.