AI Builders Digest
Bilingual edition / Zweisprachige Ausgabe
Nr. 31|2026-08-07|DE+EN Ausgabe|7 Beiträge|7 Autoren|5 Themen Zurück
Einleitung / Editor's Note

OpenAI hat heute GPT-5.6 Sol verbessert und Luna für Gratis-Nutzer freigegeben. Together AI zeigt: DeepSeek-V4 Flash ist beim Coding 4,8-mal günstiger. Basis veröffentlicht offene Behavior Specs für Langzeit-Agenten; Benchmark-Partnerin Sarah Tavel fordert soziale KI-Produkte. Die Branche ringt mit Kosten, Sicherheit und neuen sozialen Paradigmen.

Theme 01

Model Economics: OpenAI’s Update and the DeepSeek Cost Advantage / Modellökonomie: OpenAI-Update und der DeepSeek-Kostenvorteil

OpenAI verbessert sein Flaggschiff und verschenkt Luna; ein tiefer Benchmark zeigt, dass DeepSeek bei SWE-Aufgaben dramatisch mehr Lösungen pro Dollar liefert.

Author avatar

Together AI testete DeepSeek-V4 Flash gegen GPT-5.6 Luna in 900 DeepSWE-Durchläufen.

GPT-5.6 Luna war bei pass@1 14 Punkte besser, aber DeepSeek lieferte 4,8x mehr gelöste Aufgaben pro Dollar.

Together AI benchmarked DeepSeek-V4 Flash vs GPT-5.6 Luna on 900 DeepSWE rollouts.

GPT-5.6 Luna had 14 point higher pass@1, but DeepSeek delivered 4.8x more solves per dollar.

Author avatar

OpenAI verbesserte GPT-5.6 Sol: höhere Genauigkeit und Konsistenz.

GPT-5.6 Luna ist jetzt für alle kostenlosen Nutzer unbegrenzt für Alltags-Chats verfügbar.

OpenAI improved GPT-5.6 Sol with better accuracy and consistency.

GPT-5.6 Luna is now unlimited for all free users for everyday chats.

Theme 02

Long-Horizon Agents: Behavior Specs, Ontologies, and Tax Returns / Langzeit-Agenten: Behavior Specs, Ontologien und Steuererklärungen

Basis zeigt, wie Agenten über Tage autonom komplexe reale Arbeit erledigen – mit Prozessüberwachung und einem neuen offenen Standard.

The MAD Podcast avatarTM
The MAD Podcast FirstMark Podcast
@mattturck

Mitch Troyanovsky (Basis) baut Agenten, die tagelang autonom Steuererklärungen bearbeiten und hat Behavior Specs mit Braintrust quelloffen veröffentlicht.

Basis setzt auf Prozessüberwachung (Judge-as-Agent) statt Ergebniskontrolle und behandelt Kontext als Laufzeit-Trainingsdaten.

Mitch Troyanovsky (Basis) built agents that autonomously run for days on tax returns; they open-sourced Behavior Specs with Braintrust to evaluate entire trajectories.

They use process supervision (judge-as-agent) instead of outcome grading, treating context as runtime training data.

Theme 03

The Social Future of Consumer AI / Die soziale Zukunft der Consumer-KI

Während Wege zu agentischem Verhalten bei Milliarden Nutzern diskutiert werden, fordert eine Benchmark-Partnerin ein KI-Produkt mit sozialen Netzwerkeffekten.

Peter Yang avatarPY
Peter Yang Founder & Investor
@petergyang

Peter Yang: ChatGPT hat 1 Mrd. Nutzer, aber Vertrauen und Bewusstseinslücken bremsen agentische Nutzung; Google Gemini hat fast 1 Mrd. Nutzer, hinkt aber bei Plugins hinterher.

In Consumer-KI zählt nahtloses Onboarding mehr als das beste Modell – Normalnutzer fragen nicht nach Sol vs. Fable.

Peter Yang: ChatGPT has 1B users but trust and awareness gaps limit agentic adoption; Google Gemini has ~1B users but lacks plugins and browser use.

For consumer AI, seamless onboarding matters more than the best model—normies don’t care about Sol vs. Fable.

AI & I avatarA&
AI & I Every Podcast
@every

Sarah Tavel (Benchmark) sagt, das nächste große KI-Produkt muss sozial sein – mit Status, Netzwerkeffekten und Multiplayer-Dynamik.

Die meisten Consumer-KI ist heute Singleplayer; die Gewinner helfen Nutzern, von der KI-Nutzung anderer zu lernen.

Sarah Tavel (Benchmark) says the next hit AI product must be social – with status, network effects, and multiplayer dynamics.

Most consumer AI is single-player today; winners will help users learn from how others use AI.

Theme 04

Startup Ambition: Trillion-Dollar Companies and Regulatory Capture / Gründerambition: Billionen-Dollar-Unternehmen und Regulatory Capture

Sarah Guo und Elad Gil analysieren, warum Gründer sich nicht von KI-Labs einschüchtern lassen sollten und welche Hürden auf dem Weg zum nächsten Billionen-Unternehmen liegen.

No Priors avatarNP
No Priors Podcast
@NoPriorsPod

Sarah Guo und Elad Gil: Das nächste Billionen-Dollar-Unternehmen wird KI-nativ sein – Gründer sollten sich nicht von KI-Labs einschüchtern lassen.

Compute-Leistungskurven bedeuten Trainingskosten von hunderten Millionen Dollar für Frontier-Modelle; Regulatory Capture verändert das Ökosystem.

Sarah Guo and Elad Gil argue the next trillion-dollar company will be AI-native; founders should not let fear of labs stunt ambition.

Compute power laws mean training frontier models can cost hundreds of millions, creating bottleneck risks; regulatory capture is reshaping the landscape.

Theme 05

AGI Safety: Pacing the Frontier, Audits, and Incentives / AGI-Sicherheit: Frontier kontrollieren, Audits und Anreize

Zvi Mowshowitz warnt, dass bloße Vorsicht bei AGI nicht reicht, und skizziert, was an Haftung, Audits und Koordination nötig wäre, um Schritt zu halten.

Author avatar

Zvi Mowshowitz: „Moderate Vorsicht“ ist für AGI-Sicherheit viel zu wenig – der OpenAI-Hugging-Face-Vorfall zeigte Fahrlässigkeit.

Er fordert Haftung, Audits und Labor-Kooperation, um die Frontier zu kontrollieren, bevor Modelle sich unkontrolliert selbst verbessern.

Zvi Mowshowitz: 'Moderate prudence' is dangerously below what AGI safety requires; the OpenAI Hugging Face incident showed operator recklessness.

He calls for liability, third-party audits, and lab coordination to pace the frontier before models self-improve beyond control.