User Tools

Site Tools


nlp:vision_and_language

Differences

This shows you the differences between two versions of the page.

Link to this comparison view

Both sides previous revisionPrevious revision
nlp:vision_and_language [2025/07/03 04:05] – [Overviews] jmflanignlp:vision_and_language [2026/07/22 06:18] (current) – [Multimodal Foundation Models (Visual Language Models)] jmflanig
Line 23: Line 23:
   * [[https://arxiv.org/pdf/2403.05530|Gemini-team 2024 - Gemini 1.5: Unlocking Multimodal Understanding Across Millions of Tokens of Context]]   * [[https://arxiv.org/pdf/2403.05530|Gemini-team 2024 - Gemini 1.5: Unlocking Multimodal Understanding Across Millions of Tokens of Context]]
   * [[https://arxiv.org/pdf/2405.09818|Meta 2024 - Chameleon: Mixed-Modal Early-Fusion Foundation Models]]   * [[https://arxiv.org/pdf/2405.09818|Meta 2024 - Chameleon: Mixed-Modal Early-Fusion Foundation Models]]
 +  * [[https://arxiv.org/pdf/2606.17030|Qwen 2026 - Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation]]
  
 ==== Prompting Methods ==== ==== Prompting Methods ====
nlp/vision_and_language.txt · Last modified: 2026/07/22 06:18 by jmflanig

Donate Powered by PHP Valid HTML5 Valid CSS Driven by DokuWiki