Concept icon
Concept

Multimodal Input Processing in GPT-4

GPT-4 accepts inputs composed of arbitrarily interlaced text and images, enabling users to specify vision and language tasks in a manner parallel to text-only settings. Across a diverse range of visual domains—including documents containing mixed text and photographs, diagrams, and screenshots—the model generates text outputs while demonstrating capabilities comparable to its performance on purely text-based inputs.

0

1

Concept icon
Updated 2026-09-07

Tags

Prep Sessions

Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Ch.2 Model Scaling and Capability Evaluation - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor

Visual Inputs and Multimodal Processing - Transformer Architecture and Large Language Model Capabilities @ University of Michigan - Ann Arbor