AbstractAcknowledgements9.1. Introduction9.2. Related Work9.3. Multimodal Text–Image Embedding9.4. Text Embeddings9.5. Benchmarks9.6. Retrieval on InstaCities1M and WebVision Datasets9.7. Retrieval in the MIRFlickr Dataset9.8. Comparing the Image and Text Embeddings9.9. Visualizing CNN Activation Maps9.10. Visualizing the Learned Semantic Space with t-SNE9.11. ConclusionsReferences