Foundation Models Bildeingabe in iOS 27
iOS 26 gab einer App ein geräteinternes großes Sprachmodell, das Text las und Text schrieb. iOS 27 verleiht demselben Modell ein Paar Augen. Auf der WWDC26 bestätigte Apple, dass das geräteinterne System-Sprachmodell „auch Vision-Fähigkeiten erhält, die ganze neue Anwendungskategorien erschließen”,1 und der Weg zu diesen Fähigkeiten ist beinahe unspektakulär: Sie legen ein Bild neben die Worte in den Prompt, als Anhang, und stellen Ihre Frage. Keine separate Vision-Pipeline, kein Modellwechsel, kein neuer Sitzungstyp. Der Prompt, der früher einen String trug, trägt nun auch ein Bild, und das Modell antwortet zu beidem.
Warum die kleine Angriffsfläche die eigentliche Schlagzeile ist: Bildeingabe ist keine Beiwagen-API, die nachträglich an Foundation Models geschraubt wurde. Apple beschreibt sie als „eine natürliche Erweiterung der bestehenden Prompt-Builder”,1 womit jedes Konzept, das Sie in iOS 26 bereits gelernt haben (Sitzungen, Guided Generation, das Tool-Protokoll), unverändert weiterfunktioniert, sobald ein Prompt multimodal wird.4 Falls Ihnen LanguageModelSession noch nicht begegnet ist, beginnen Sie mit dem Foundation-Models-Framework-Erklärstück und kommen Sie dann zurück.
Kurz gesagt
- Das geräteinterne Modell von iOS 27 akzeptiert Bildeingabe. Sie fügen einen Bildanhang neben dem Text in Ihren Prompt ein, und das Modell beantwortet Fragen zum Bild12.
- Bildanhänge lassen sich aus einer Vielzahl von Typen erstellen:
UIImage,NSImage,CGImage, Core-Image-Typen, CoreVideo-Pixel-Buffern und Datei-URLs1. - Das Modell unterstützt Bilder in jeder Größe und jedem Seitenverhältnis, sodass Sie nicht auf eine Form zuschneiden oder auffüllen müssen; größere Bilder verbrauchen jedoch mehr Token und verursachen mehr Latenz1.
- Foundation Models verleiht dem LLM breite Vielseitigkeit bei einem Bild; das Vision-Framework liefert feste, schnelle, feinabgestimmte Analyse. Apples Empfehlung lautet, sie über Tool Calling zu kombinieren, statt sich zu entscheiden2.
- Auch das Servermodell auf Private Cloud Compute unterstützt Bildeingabe, und zwar mit einem Kontextfenster von 32K (gegenüber 4K geräteintern), sodass multimodale Prompts mit Text plus mehreren Bildern Luft zum Atmen haben3.
Was sich geändert hat: Der Prompt bekam ein Bild
In Session 241 ist Apples Formulierung präzise. Das geräteinterne Modell „ist intelligenter; besser in Logik und Tool Calling”, und zusätzlich zu dieser Intelligenz erhält es nun Vision.1 Die Demo fragt das Modell zu einem Foto von Origami: „Fügen Sie einfach einen Bildanhang zusammen mit Text in Ihren Prompt ein. Nun kann das Modell Fragen zum Bild beantworten.”1 Auf die Reihenfolge kommt es an. Text und Bild leben im selben Prompt, das Modell liest den gesamten Prompt, und die Antwort schlussfolgert über beides.
Die Menge der Quelltypen ist breit genug, dass Sie selten selbst etwas konvertieren müssen. Apple nennt sechs: Bildanhänge „lassen sich aus einer Vielzahl von Typen erstellen, darunter UIImage, NSImage, CGImage, Core-Image-Typen, CoreVideo-Pixel-Buffer und Datei-URLs”.1 Ein UIImage direkt aus PhotosPicker, ein bereits gerendertes CGImage, ein als CVPixelBuffer von der Kamera abgegriffenes Frame oder eine Datei auf der Festplatte per URL werden allesamt zu gültiger Eingabe. Das Transkript benennt die Eingabetypen, nicht aber die genauen Signaturen der Anhang-Initialisierer; behandeln Sie die Typliste daher als den Vertrag und lassen Sie die Xcode-Autovervollständigung die Aufrufstelle ausfüllen, sobald Sie auf dem iOS-27-SDK arbeiten.
Eine Einschränkung müssen Sie nicht bekämpfen: die Form. „Das Modell unterstützt Bilder in jeder Größe und jedem Seitenverhältnis, sodass Sie nicht auf eine bestimmte Form zuschneiden oder auffüllen müssen.”1 Eine hohe Quittung, ein breites Panorama und ein quadratisches Vorschaubild sind allesamt unverändert akzeptabel. Der Preis ist genau jener, den man von jedem token-budgetierten Modell erwartet: „Beliebige Bildgrößen sind erlaubt, doch bedenken Sie, dass größere Bilder mehr Token verbrauchen und mehr Latenz verursachen.”1 Ein Bild ist kein kostenloser Kontext. Es zehrt vom selben Budget wie Ihr Text, und genau das ist die erste Designentscheidung, die Ihnen Multimodalität aufzwingt, und der Grund, warum die Kontextgröße (weiter unten behandelt) tragend wird.
Da die Bildeingabe auf dem bestehenden Prompt-Builder aufsetzt, bleibt die iOS-26-Maschinerie intakt. Guided Generation formt die Ausgabe weiterhin in einen @Generable-Typ. Das Tool-Protokoll lässt das Modell weiterhin Ihren Code aufrufen. Streaming streamt weiterhin. Das Modell hat einen Sinn dazugewonnen, kein neues Programmiermodell.
Die Verbindung zum Bildverständnis: Foundation Models und Vision sind keine Rivalen
Session 237, „Was neu ist beim Bildverständnis”, ist der Ort, an dem Apple die Grenze zwischen den beiden Wegen zieht, ein Bild zu analysieren, und diese Unterscheidung ist das Nützlichste in beiden Vorträgen, um zu entscheiden, was man baut. Schon der Einstieg verrät viel: Die Agenda der Vortragenden ist verschwunden, sie fotografiert ihre Haftnotizen und bittet „ein großes Sprachmodell, eine Agenda zu generieren. Mit dem Foundation-Models-Framework geht das ziemlich leicht. Erfreulicherweise unterstützt Foundation Models dieses Jahr Bildeingaben.”2 Das ist die gesamte Verkaufsbotschaft für die deskriptive Seite der Multimodalität: Bilder beschriften, aus dem Foto eines Zimmers Vorschläge zur Inneneinrichtung ableiten, aus dem Bild eines Kühlschranks ein Rezept generieren. Das Urteil der Vortragenden dazu, wo das LLM glänzt: „Modelle sind in der Regel gut bei deskriptiven Aufgaben.”2
Dann folgt der ehrliche Vergleich. „Das Foundation-Models-Framework nutzt große Sprachmodelle, die nahezu alles tun können, worum Sie sie bitten. Im Vergleich dazu verwenden traditionelle Bildverarbeitungs-Frameworks wie Vision einen festen Satz von Computer-Vision-APIs. Vision-APIs sind für bestimmte Aufgaben feinabgestimmt, die sie wirklich gut erledigen. Und Vision ist schnell. Oft schnell genug, um Videoframes in Echtzeit zu analysieren.”2 Lesen Sie das als Routing-Regel. Eine offene Frage zu einem Standbild, bei der Sie Sprache zurück möchten? Foundation Models. Eine konkrete, klar umrissene Aufgabe in Videoframe-Geschwindigkeit (Gesichtserkennung, Pose, Saliency, Segmentierung)? Vision. Das LLM ist ein Generalist, der denkt; die Vision-API ist ein Spezialist, der läuft.
Apples Pointe lautet, dass Sie sich nicht entscheiden müssen: „Sie müssen sich nicht immer zwischen Vision und Foundation Models entscheiden, um Ihre Bilder zu analysieren. Es gibt einen Weg, die Expertise von Vision mit der Vielseitigkeit von Foundation Models über Tool Calling zu verbinden.”2 Das Tool Calling von iOS 27 unterstützt nun Bildargumente. Wenn ein Modell etwas nicht selbst erkennen kann (der Vortrag verwendet Pflanzenbestimmung), ruft es ein Tool auf, und „statt das gesamte Bild als Argument zu übergeben, übergibt das Modell stattdessen eine Referenz auf das Bild”.2 Diese Referenz, eine ImageReference, „muss eine Referenz auf ein vorhandenes Bild aus der aktuellen Chat-Sitzung sein”,2 das das Tool über den Verlauf der Sitzung wieder in einen Anhang auflöst, bereit zur Analyse. Die Steuerungsschleife sowie das eingebaute OCRTool und BarcodeReaderTool sind Thema des Begleitstücks, Tool-Calling-Steuerung in iOS 27; hier ist der Punkt enger gefasst: Bildeingabe und Bildargument-Tools sind zwei Schichten desselben multimodalen Stacks, und sie greifen ineinander.
Multimodal auf Private Cloud Compute: gleicher Prompt, mehr Raum
LanguageModelSession speist und mit dem 32K-Kontext zusammenfasst, den PCC bietet.
Session 319 beginnt damit, beide Hälften der Multimodal-Geschichte auf einmal zu bestätigen. Das geräteinterne Modell „unterstützt nun Bildeingabe, es ist besser beim Befolgen von Anweisungen und beim Aufrufen Ihrer benutzerdefinierten Tools”,3 und für die schwereren Fälle gibt es ein neues Servermodell auf Private Cloud Compute. Der Grund, warum Multimodalität und PCC in dasselbe Gespräch gehören, ist die Kontextgröße. Apple nennt die Zahlen unverblümt: „Das geräteinterne Modell bietet 4k, und mit PCC erhalten Sie 32K.”3 Ein Bild zehrt von diesem Budget1, sodass ein Prompt mit Text plus mehreren Bildern genau die Art von Nutzlast ist, die 4K strapaziert und bequem in 32K passt.
Die Zusammenfasser-Demo macht die Passung greifbar. „Hier habe ich eine App, die einen Artikel mit dem PCC-Modell zusammenfasst. Ich kann eine Markdown-Datei auswählen, wir nehmen den Text und die Bilder, speisen das in eine LanguageModelSession und erzeugen eine Zusammenfassung. Das funktioniert hervorragend mit der großen Kontextgröße, die PCC bietet.”3 Text und Bilder, eine Sitzung, ein Prompt. Die Migrationskosten vom Gerät zum Server betragen eine Zeile: Apple zeigt, dass „Sie durch Ändern von nur einer Codezeile auf das neue Servermodell auf PCC umstellen können”,3 denn „das Foundation-Models-Framework bietet eine einheitliche Swift-API, unabhängig davon, mit welchem Modell Sie sprechen”.3 Guided Generation mit Generable und Tool Calling „funktioniert mit dem PCC-Modell genauso wie mit dem geräteinternen Modell”.3
PCC fügt Reasoning hinzu, das geräteintern nicht vorhanden ist, und Reasoning hat einen multimodal relevanten Preis: „Reasoning ist zusätzlicher Text, den das Modell generiert. Es verbraucht also Token. Das zählt zu Ihrer Kontextgrößenbegrenzung.”3 Kombinieren Sie tiefes Reasoning mit mehreren Bildern in voller Auflösung in einem Prompt, und Sie verbrauchen das 32K-Budget von beiden Enden her. Die tiefergehenden Details (die drei Reasoning-Stufen, die Handhabung von quotaUsage und isLimitReached beim Tageslimit, die Berechtigung, die Sie auf der Entwicklerseite beantragen) gehören in den Private-Cloud-Compute-Tiefgang; die multimodale Erkenntnis lautet, dass derselbe bildtragende Prompt auf beiden Modellen läuft und das Servermodell genau dann existiert, wenn der Prompt dem Gerät entwächst.
Bildeingabe einführen
Eine kurze Checkliste, die sich aus den obigen Verträgen ergibt.
Geräteintern starten, messen, dann entscheiden. Apples eigener Rat lautet, das Modell „anhand von Daten zu wählen, nicht nur nach Gefühl”,3 und warnt: „Sie werden vielleicht überrascht sein, wie gut das geräteinterne Modell bei bestimmten Aufgaben abschneidet, besonders mit dem dieses Jahr aktualisierten Modell.”3 Eine Bildunterschrift oder eine Was-ist-dieses-Objekt-Anfrage braucht womöglich nie PCC. Greifen Sie zum Servermodell, wenn der Prompt mehrere Bilder oder langen Text trägt, der das geräteinterne 4K-Fenster überläuft3.
Wählen Sie den günstigsten Quelltyp für Ihre Pipeline. Sie können dem Modell ein UIImage, NSImage, CGImage, einen Core-Image-Typ, CVPixelBuffer oder eine Datei-URL übergeben1. Falls ein Frame bereits als Pixel-Buffer von der Kamera oder als Datei auf der Festplatte vorliegt, übergeben Sie es direkt, statt den Umweg über UIImage zu nehmen.
Behandeln Sie die Bildauflösung als Budget-Stellschraube, nicht als Qualitätsregler. Jede Größe und jedes Seitenverhältnis ist zulässig1, widerstehen Sie also dem übermäßigen Zuschneiden auf die Form. Doch da größere Bilder mehr Token und mehr Latenz kosten1, skalieren Sie ein 48-Megapixel-Foto herunter, bevor es in einen Prompt eingeht, wenn die Aufgabe (dieses Schild lesen, welcher Raum ist das) nicht jeden Pixel braucht.
Leiten Sie nach Aufgabe, nicht nach Reflex. Deskriptive, offene Arbeit mit Sprachausgabe geht an Foundation Models; feste, schnelle Echtzeit-Computer-Vision-Arbeit geht an Vision; wenn Sie beides brauchen, rufen Sie Vision aus einem Foundation-Models-Tool heraus auf2. Die beiden Frameworks sind komplementäre Schichten, und das Bildargument-Tool ist die Naht, die sie verbindet.
Behalten Sie die Verfügbarkeitsprüfung bei. Bildeingabe setzt auf demselben Modell auf, und das Modell ist „nur auf Apple-Intelligence-Geräten verfügbar”.3 Prüfen Sie die Verfügbarkeits-API und bauen Sie dort, wo Apple Intelligence fehlt, eine elegante Rückfalllösung ein3.
FAQ
Wie sende ich in iOS 27 ein Bild an das Foundation-Models-Modell?
Sie fügen einen Bildanhang neben dem Text in Ihren Prompt ein, unter Verwendung des bestehenden Prompt-Builders, und bitten dann das Modell um eine Antwort. Apple beschreibt die API als „eine natürliche Erweiterung der bestehenden Prompt-Builder”: Sitzung erstellen, „fügen Sie einfach einen Bildanhang zusammen mit Text in Ihren Prompt ein”, und „das Modell kann Fragen zum Bild beantworten”.1 Weder eine separate Vision-Pipeline noch ein neuer Sitzungstyp sind beteiligt.
Welche Bildtypen kann ich an Foundation Models übergeben?
Bildanhänge lassen sich aus UIImage, NSImage, CGImage, Core-Image-Typen, CoreVideo-Pixel-Buffern und Datei-URLs erstellen1. Das Transkript zählt diese Quelltypen auf; es nennt nicht jede Initialisierer-Signatur, lassen Sie also das iOS-27-SDK die genaue Aufrufstelle liefern.
Muss ich Bilder vor dem Senden skalieren oder zuschneiden?
Nein. „Das Modell unterstützt Bilder in jeder Größe und jedem Seitenverhältnis, sodass Sie nicht auf eine bestimmte Form zuschneiden oder auffüllen müssen.”1 Der Kompromiss ist Kosten, nicht Zulässigkeit: „größere Bilder verbrauchen mehr Token und verursachen mehr Latenz”,1 sodass das Herunterskalieren eines sehr großen Fotos eine Budgetentscheidung ist, wenn die Aufgabe nicht die volle Auflösung braucht.
Wann sollte ich für ein Bild Vision statt Foundation Models verwenden?
Verwenden Sie Vision für feste, klar umrissene, geschwindigkeitskritische Aufgaben. Apple merkt an, dass Vision „einen festen Satz von Computer-Vision-APIs verwendet”, „für bestimmte Aufgaben feinabgestimmt” ist und „oft schnell genug ist, um Videoframes in Echtzeit zu analysieren”, während Foundation Models „nahezu alles tun kann, worum Sie es bitten” und bei deskriptiven Aufgaben glänzt2. Wenn Sie beides möchten, rufen Sie über Tool Calling ein Vision-gestütztes Tool aus einer Foundation-Models-Sitzung heraus auf2.
Funktioniert Bildeingabe mit dem Servermodell auf Private Cloud Compute?
Ja. Apple bestätigt, dass das geräteinterne Modell „nun Bildeingabe unterstützt”,3 und die PCC-Demo speist „den Text und die Bilder” eines Dokuments zur Zusammenfassung in eine LanguageModelSession3. Dieselbe einheitliche Swift-API läuft auf beiden Modellen, sodass derselbe bildtragende Prompt mit einer einzeiligen Änderung geräteintern oder auf dem Server funktioniert. Der 32K-Kontext von PCC (gegenüber 4K geräteintern) gibt Prompts mit mehreren Bildern mehr Raum3.
Das vollständige Apple-Ecosystem-Cluster: das Foundation-Models-Framework-Erklärstück; das geräteinterne LLM; die Tool-Calling-Steuerung in iOS 27; und der Private-Cloud-Compute-Tiefgang. Der Knotenpunkt ist die Apple-Ecosystem-Serie. Für breiteren Kontext zu iOS mit KI-Agenten siehe den Leitfaden zur iOS-Agent-Entwicklung.
-
Apple, WWDC26-Session 241, „What’s new in the Foundation Models framework.” developer.apple.com/videos/play/wwdc2026/241. Apple erklärt, das geräteinterne Modell „erhält auch Vision-Fähigkeiten”, beschreibt die API als „eine natürliche Erweiterung der bestehenden Prompt-Builder”, bei der Sie „einfach einen Bildanhang zusammen mit Text in Ihren Prompt einfügen”, listet die unterstützten Quelltypen auf (
UIImage,NSImage,CGImage, Core-Image-Typen, CoreVideo-Pixel-Buffer und Datei-URLs) und merkt an, das Modell „unterstützt Bilder in jeder Größe und jedem Seitenverhältnis”, während „größere Bilder mehr Token verbrauchen und mehr Latenz verursachen”. ↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩ -
Apple, WWDC26-Session 237, „What’s new in image understanding.” developer.apple.com/videos/play/wwdc2026/237. Apple erklärt, „dieses Jahr unterstützt Foundation Models Bildeingaben”, stellt das Foundation-Models-LLM („kann nahezu alles tun, worum Sie es bitten”, stark bei deskriptiven Aufgaben) dem Vision-Framework gegenüber („ein fester Satz von Computer-Vision-APIs”, „für bestimmte Aufgaben feinabgestimmt”, „schnell genug, um Videoframes in Echtzeit zu analysieren”) und zeigt Tool Calling, das Bildargumente über eine
ImageReferenceauf „ein vorhandenes Bild aus der aktuellen Chat-Sitzung” unterstützt, das über den Verlauf der Sitzung aufgelöst wird. ↩↩↩↩↩↩↩↩↩↩↩ -
Apple, WWDC26-Session 319, „Build with the new Apple Foundation Model on Private Cloud Compute.” developer.apple.com/videos/play/wwdc2026/319. Apple bestätigt, das geräteinterne Modell „unterstützt nun Bildeingabe”, erklärt „das geräteinterne Modell bietet 4k, und mit PCC erhalten Sie 32K”, zeigt den Wechsel zum PCC-Servermodell „durch Ändern von nur einer Codezeile” über „eine einheitliche Swift-API”, demonstriert das Einspeisen von „dem Text und den Bildern” eines Dokuments in eine
LanguageModelSession, rät, ein Modell „anhand von Daten zu wählen, nicht nur nach Gefühl”, und merkt an, Reasoning „ist zusätzlicher Text, den das Modell generiert”, der „zu Ihrer Kontextgrößenbegrenzung zählt”. ↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩ -
Apple Developer, Dokumentation zum „Foundation Models”-Framework. Referenz für
LanguageModelSession, den Prompt-Builder, Guided Generation über@Generableund dasTool-Protokoll, das die Bildeingabe- und Bildargument-Funktionen von iOS 27 erweitern. ↩