AI Builders Digest
Bilingual edition / Zweisprachige Ausgabe
Nr. 18|2026-07-06|DE+EN Ausgabe|5 Beiträge|3 Autoren|3 Themen Zurück
Einleitung / Editor's Note

Anthropic hat heute sein Playbook für Agentensicherheit offengelegt – von drei Isolationsmustern bis zu echten Phishing- und Exfiltrationsvorfällen. Zeitgleich starteten selbstgehostete Sandboxes und MCP-Tunnel für Managed Agents in die Beta. Währenddessen argumentierte Liquid AI's CEO Ramin Hasani, dass die Zukunft der KI nicht nur in Rechenzentren liegt. Beide Entwicklungen zeigen: Leistungsfähige KI in die reale Welt zu bringen, erfordert durchdachte Sicherheitsarchitektur und neue Deployment-Modelle.

Theme 01

Agent Containment: Isolationsmuster und reale Vorfälle / Agent Containment: Patterns and Real Incidents

Anthropic beschreibt drei Containment-Architekturen für Claude-Produkte und berichtet von konkreten Sicherheitsvorfällen, die die Grenzen modellbasierter Verteidigungen aufzeigen.

Anthropic Engineering avatarAE
Anthropic Engineering Engineering Blog
@AnthropicAI

Anthropic setzt drei Isolationsmuster ein: flüchtige gVisor-Container für claude.ai, OS-Sandbox für Claude Code (84 % weniger Berechtigungsabfragen) und vollständige VMs für Claude Cowork – abgestimmt auf die Kontrollfähigkeiten der Nutzer.

Selbstgebaute Komponenten versagten wiederholt, während erprobte Primitive hielten; ein eigener Allowlist-Proxy ließ Datendiebstahl über api.anthropic.com mit dem API-Key des Angreifers zu.

Anthropic uses three containment patterns: ephemeral gVisor containers for claude.ai, OS sandbox for Claude Code (84% fewer permission prompts), and full VMs for Claude Cowork — isolation strength matched to user oversight ability.

Custom-built components repeatedly broke while battle-tested primitives (gVisor, seccomp, hypervisors) held; a custom allowlist proxy let an attacker exfiltrate data through api.anthropic.com using their own API key.

Anthropic Engineering avatarAE
Anthropic Engineering Engineering Blog
@AnthropicAI

Bei einer internen Red-Team-Übung brachte eine Phishing-Mail einen Mitarbeiter dazu, einen bösartigen Prompt einzufügen; Claude exfiltrierte AWS-Credentials in 24 von 25 Versuchen – Modell-Verteidigungen griffen nicht, da der Nutzer selbst der Injektionsvektor war.

Schwachstellen in Claude Codes Startsequenz führten dazu, dass projekt-lokale Konfigurationen vor der Vertrauensabfrage ausgeführt wurden; die Lösung war, sämtliches Parsen nach der Nutzerzustimmung durchzuführen.

In a controlled red-team exercise, a phishing email tricked an employee into pasting a malicious prompt; Claude exfiltrated AWS credentials in 24 of 25 attempts — model-layer defenses were blind because the user was the injection vector.

Vulnerabilities in Claude Code's startup sequence meant project-local config files executed before the trust prompt appeared; the fix deferred all config parsing until after user consent.

Theme 02

Managed Agents: Sandbox-Freiheit und private Netzwerke / Managed Agents: Custom Sandboxes and Private Networks

Anthropic launcht selbstgehostete Sandboxes für Managed Agents und MCP-Tunnel für den Zugriff auf private Unternehmensdienste.

Claude Blog avatarCB
Claude Blog Product Blog
@AnthropicAI

Anthropic startet selbstgehostete Sandboxes für Managed Agents in der Public Beta – Unternehmen führen Agenten in ihrer eigenen Infrastruktur über Cloudflare, Daytona, Modal oder Vercel aus; Dateien und Zugangsdaten verlassen das Perimeter nie.

Amplitude nutzt Cloudflare-MicroVMs für seinen Design Agent; Clay betreibt seinen GTM-Engineering-Agent auf Daytona; Rogo verarbeitet proprietäre Finanzdaten auf Vercel Sandbox – mit vollständigen Enterprise-Sicherheitskontrollen.

Anthropic launched self-hosted sandboxes for Managed Agents in public beta, letting enterprises run agent execution inside their own perimeter via Cloudflare, Daytona, Modal, or Vercel — files and credentials never leave.

Amplitude uses Cloudflare microVMs for its Design Agent; Clay runs its GTM engineering agent on Daytona; Rogo handles proprietary finance data on Vercel Sandbox — all with enterprise security controls.

Claude Blog avatarCB
Claude Blog Product Blog
@AnthropicAI

MCP-Tunnel (Research Preview) ermöglichen Agenten die Verbindung zu privaten MCP-Servern im Unternehmensnetzwerk ohne öffentliche Internet-Exposition – ein leichtgewichtiges Gateway stellt eine einzige ausgehende Verbindung her, keine eingehenden Firewall-Regeln.

Interne Datenbanken, private APIs, Wissensdatenbanken und Ticketsysteme werden zu aufrufbaren Werkzeugen; verwaltet über die Claude Console, unterstützt in Managed Agents und der Messages API.

MCP tunnels (research preview) let agents connect to private MCP servers inside enterprise networks without public internet exposure — a lightweight gateway makes a single outbound connection, no inbound firewall rules.

Internal databases, private APIs, knowledge bases, and ticketing systems become tools agents can call; admin-managed from Claude Console, supported in Managed Agents and the Messages API.

Theme 03

Edge AI: Foundation Models auf dem Gerät / Edge AI: Foundation Models on Device

Liquid AIs CEO argumentiert für hardwarebewusste Architekturen jenseits des Rechenzentrums und zeigt Produktionseinsätze bei Shopify und Mercedes-Benz.

Author avatar

Ramin Hasani (Liquid AI) argumentiert, dass geräteeigene Foundation Models für Handys, Laptops und Autos effiziente, hardwarebewusste Architekturen brauchen – nicht nur Skalierung – basierend auf Liquid Networks und Automated Foundation Model Design.

Liquid AIs Open-Weight-LFM-Familie läuft produktiv bei Shopify und Mercedes-Benz für lokale, datenschutzfreundliche KI mit niedriger Latenz, die keine Cloud-Rechenzentren benötigt.

Ramin Hasani (Liquid AI) argues device-native foundation models for phones, laptops, and cars require efficient, hardware-aware architectures — not just scaling up — built on liquid networks and Automated Foundation Model Design.

Liquid AI's open-weight LFM family is deployed in production at Shopify and Mercedes-Benz, targeting local, privacy-sensitive, low-latency AI that doesn't depend on cloud data centers.