GPT-6 Sol und Luna: 50 Prozent günstiger, gleiche Scores. OpenAI senkt die API-Preise der GPT-6-Linie um die Hälfte. Sol kostet jetzt 2 $ für Input und 10 $ für Output je Million Token, Luna 0,10 $ und 0,50 $. Beide Werte liegen exakt 50 Prozent unter den Preisen von GPT-5.6. Der Grund steht in der Ankündigung: besseres Caching und günstigere Inference. OpenAI gibt die Ersparnis direkt an die Preise weiter, statt sie einzubehalten. Interessant wird der Blick auf die Scores. Auf AutomationBench 1.0.6, einem Test über 47 Tools in Verkauf, Marketing und Support, erreicht Sol 33,2 Prozent bei 0,27 $ je Task. Opus 5 (max) liegt bei 26,9 Prozent und kostet das 11,1-fache je Task. Astra (low) schafft 30,3 Prozent zum 3,9-fachen Preis. Auf Agents' Last Exam steht Sol bei 56,4 Prozent, also 60 Prozent günstiger je Task als der beste Opus-5-Wert der Auswertung. Das bedeutet für eure Kalkulation: 1. Budget prüfen: Wer noch mit den Preisen von GPT-5.6 rechnet, zahlt das Doppelte. 2. Massenläufe gehören auf Luna, komplexe Tasks auf Sol. 3. Caching-Quote prüfen, bevor ein Wechsel gerechnet wird. „Kopierfertig für die nächste Rechnung: Input-Tokens mal 2 $ plus Output-Tokens mal 10 $, geteilt durch eine Million, minus euren Caching-Rabatt. Für Luna dasselbe mit 0,10 $ und 0,50 $." Die komplette Preisliste findet ihr im Carousel. Welcher eurer Workflows läuft ab morgen auf Luna statt Sol? #AI #LLMs
Context Studios - KI Development Studio & Agentur Berlin
Softwareentwicklung
AI-Native Development Studio - Ihre Software. Ihre KI. Nach Maß.
Info
Context Studios ist ein KI-natives Entwicklungsstudio, das sich auf individuelle Webanwendungen, native Mobile Apps und intelligente Automatisierungslösungen für B2B und B2C spezialisiert hat. Wir verbinden modernste KI-Technologie mit strategischer Beratung und helfen Unternehmen, künstliche Intelligenz effektiv in ihre Entwicklung und Prozesse zu integrieren. Parallel zu Kundenprojekten bauen, launchen und vermarkten wir eigene innovative Produkte – immer mit unserem bewährten AI-First-Ansatz. Egal ob Custom-Lösung oder KI-Transformation: Wir liefern messbare Resultate.
- Website
-
https://contextstudios.ai/?utm_source=linkedin&utm_medium=social&utm_campaign=linkedin_landing_page
Externer Link zu Context Studios - KI Development Studio & Agentur Berlin
- Branche
- Softwareentwicklung
- Größe
- 1 Beschäftigte:r
- Hauptsitz
- Berlin
- Art
- Kapitalgesellschaft (AG, GmbH, UG etc.)
- Gegründet
- 2025
- Spezialgebiete
- Vibecoding, Context Engineering, AI Agent Coding, AI Coding, MVP Development, API Custom Solutions, Web Apps, Native Mobile Apps, B2B & B2C App Development, AI First Company, In-House Software Development, Web Development, Agent Development, Workflow Automation und Development Studio
Orte
-
Primär
Wegbeschreibung
Berlin, DE
Updates
-
9 Loops in einem Durchgang. Die alte Decke: 8. Die Streuungsartefakte der Teilchenphysik sind ein gutes Maß für Rechenleistung. Die meisten enden bei zwei Loops. Das beste menschliche Ergebnis: fünf. Lance Dixon hebt N=4-SYM per Bootstrap auf acht — vor einigen Jahren. Claude Fable 5.1 setzt neun. Der Prompt lautet: ``` Compute the hexagon amplitude in planar N=4 SYM at nine loops. Keep working until I tell you to stop. Give me updates every 4–6 hours. ``` Zwei Rechenwege im selben Durchgang: Bootstrap und Form-Faktor. Dixon verifiziert das sechste Artefakt der Serie. Gesamtkosten: unter 100 $ (Bootstrap-Teil). ❌ Nur ein Rechenweg, keine unabhängige Absicherung — der Einzelweg trägt nicht. ✅ Zwei Wege, beide unabhängig prüfbar — das ist die Validierung, die zählt. Was das für produktionsreife Systeme heißt: Die Decke fällt nicht am Modell, sondern am Durchhaltungs-Loop. Klare Aufgabenstellung, kurze Update-Zyklen, kein Zwischenstopp — das trägt über die klassische Rechnung hinaus. N=4 ist ein Toy Model mit vier supersymmetrischen Partnern je Teilchen, ideal für Mechanik-Checks. #AIforschung #Physik
-
-
Voll bei 1M Tokens – gerettet wird durch die Übergabe. Das Kontextfenster ist die Arbeitsablage eines Modells: System-Prompt, jede Nachricht, jedes Tool-Ergebnis und die eigene Ausgabe zählen mit. Wächst die Zahl der Tokens, sinken Genauigkeit und Wiedergabe – die Fachwelt sagt dazu context rot. Die dokumentierte Antwort heißt Kompaktierung. So läuft der Loop im Cluster: ``` Fasse die Sitzung zusammen: Stand, Entscheidungen, offene Punkte. Starte neu mit dieser Kurzfassung als erstem Inhalt. Nur Blöcke mit Nutzen ins Fenster, der Verlauf bleibt außen. ``` ❌ Bisherigen Verlauf mitschleppen: volle Protokoll-Abdrucke, sinkende Trefferquote, steigende Kosten pro Antwort. ✅ Kompakt übergeben: drei Punkte als neuer Startpunkt, kürzere Sitzung, stabilere Rechnung. Größere Fenster helfen, sind aber kein Selbstzweck: Bei kleineren Modellen gelten 200k als Maß, Bilder pro Anfrage bis 600, bei kleineren Fenstern 100. #ContextStudios #Kuenstler
-
-
Größer ist nicht gleich besser. Die MIT-Befunde zur LLM-Skalierung zeigen eine klare Mechanik: Eine Verdopplung der Modellbreite halbiert den Fehler nur etwa einmal, danach folgt das Plateau. Der Skalen-Exponent liegt bei 0,91. Die Kurve fällt damit schneller, als lange Parameterlisten vermuten lassen. ❌ Vorher: nur die Breite verdoppelt, der Fehler sinkt einmal, dann Plateau. ✅ Nachher: dieselbe Breite mit Denkstufe, über 4-mal Nutzen pro Euro. Der zweite Hebel arbeitet deutlich günstiger. Test-Time-Compute bringt über 4-mal besseren Budget-Nutzen pro Euro. Bei einfachen wie mittleren Aufgaben reicht die denkende Variante für eine 14-fache Parität zum großen Modell, ohne dessen Preise. Für den Projektalltag heißt das: erst messen, dann modellieren. Das Rezept als Kopiervorlage: ``` A/B-Schleife, drei Zeilen: 1 Task, 1 Modell, zwei Läufe. Lauf 1 ohne Think, Lauf 2 mit Think-Stufe. Sieger ist der niedrigste Preis pro gelöster Aufgabe. ``` Quelle: https://lnkd.in/d8EGARdQ #LLM #KI
-
8 GB VRAM für ein 27B-Modell sind machbar, aber nur mit der richtigen Quantisierungsstufe. Ternary Bonsai 2 komprimiert Qwen3.8-27B auf 5,95 GB und erreicht im Schnitt 84,78 Punkte aus 14 Benchmarks. Der Q4-Bau liefert 85,18 Punkte bei 17,6 GB, FP16 kommt auf 86,32 Punkte bei 53,8 GB. Die 98,2 Prozent gelten nur im Vergleich zu FP16. Der ehrliche Maßstab im Eigenbetrieb ist Q4, denn nur 0,4 Punkte trennen die kleine Datei. ``` Fit-Check vor jeder Inbetriebnahme: ab 16 GB: Q4 – 17,6 GB – Ø 85,18 8–12 GB: Bonsai 2 – 5,95 GB – Ø 84,78 (+12,19 gegen IQ2) Loader: PrismML-Demo-Repo, Fork B10658+, Build-String prüfen Reasoning: Standard (Max ≈ 22.276 Denk-Tokens, 4–5× Latenz) Fenster: 4k ≈ 7,4 GB · 262k mit 4-Bit-KV ≈ 12,9 GB ``` ❌ Plant nur die 98-Prozent-Headline ein: Terminal-Bench misst 52,8 gegen 69,7, SWE-bench verified 60,8 gegen 80,6. ✅ Rechnet mit rund drei Viertel Retention: dann passen Latenz, Kosten und Trefferquote auf 8-GB-Karten. Was im Engineering den Ausschlag gibt: ab 16 GB nutzt man Q4, bei 8–12 GB trägt Bonsai 2. Ollama und MLX von der Stange liefern still falsche Ergebnisse, ohne Fehlermeldung. Die Modellkarte ist der Anfang der Prüfung, nicht das Ende — eigene Messung, dokumentierter Build, gerechnetes Kontextfenster. Alle Zahlen stammen aus der Modellkarte (PrismML, 17.09.) und dem Testlauf von Kai. Quelle: https://lnkd.in/dedaU6pe
-
-
Claude Opus 5.5: 40 Prozent günstiger als Fable 5.1 Anthropic hat das erste Modell der 5.5-Familie vorgestellt. Opus 5.5 hält das Niveau von Fable 5.1 und kostet dabei 40 Prozent weniger. ❌ Fable 5.1: Die Preise lagen höher, das Fenster war kleiner. ✅ Opus 5.5: Eine Million Tokens fassen den Kontext, 4 $ / 20 $ gelten pro Million Tokens, die Cache-Reads sinken um 60 Prozent. Diesen Prüfblock kannst du wörtlich in deine Projektdoku übernehmen: ``` Eingabe: Tokens × 0,000004 $ pro Token Ausgabe: Tokens × 0,00002 $ pro Token Cache-Reads: 60 Prozent unter dem alten Stand CursorBench: 57,8 Prozent als Topwert der Familie ``` Vor dem Launch testeten Frontier Design und METR das Modell extern. Opus 5.5 ist sofort in der bestehenden API verfügbar. Quelle: https://lnkd.in/g-sqf7bV #AI #Claude
-
Das Modell ist keine Konstante, sondern eine Entscheidung. Die DeepSeek-Fallstudie belegt dies anhand von vier Zahlen. 74,2 Punkte: V4.1 Flash liegt auf dem eigenen V1.1-Check knapp vor Claude Opus 5 (74,0) und GPT-5.6 Sol (73,0), wie berichtet; Stand 21.09. Beim Preis trennen die Modelle nur drei Ziffern: 1,80 stehen 8,40 Dollar gegenüber, gerechnet auf 1000 Runden mit 200k Cache-Reads. Die Zahl der gleichzeitigen Sessions steigt von 500 auf 2500, und je Token sind nur 6 von 385 Experten aktiv, mit 8 Mrd. Parametern im Leseteil und 16 Mrd. im Schreibteil. Der kopierbare Kern für den eigenen Stack: ``` model = "deepseek-v4.1-flash" # Namen hart setzen, nicht nur die Major-Version cache_reads_first = true # 200k Reads je 1000 Runden: 1,80 $ statt 8,40 $ ``` ❌ Nur „V4" ins Setup schreiben – nach 4 Tagen steht dort ein anderes Modell, und die Rücknahme nach 24 Stunden hat die Zahlensituation schon wieder gedreht. ✅ Den vollen Namen fixieren und den Changelog montags lesen: dann bleibt die Kostenrechnung pro Runde stabil, auch wenn der Anbieter umzieht. Ohne Tool-Use fallen die Faktenwerte übrigens unter 40 Punkte; das Tool neben dem Modell gehört damit zur Architektur, nicht zur Kür. Kontext Studios baut diese Stacks: deterministische Gatter, fixierte Modellnamen, durchgeplante Cache-Reads. Future-Proof Digital Engineering, ohne Hype. https://lnkd.in/ejYRbHWy
-
-
Ein Spiel aus dem Jahr 1998 legt jede moderne KI offen. Der Brood-War-Bench lässt Codex, Claude und Grok in 19 Konfigurationen antreten, wobei keines über das Anfängerniveau hinauskommt. Die Ursache ist typisch für Agentensysteme: Das Denkmodell benötigt 11.000 Tokens in 43 Minuten, aber nur sechs Befehlsserien erreichen das Spiel. ❌ 11.000 Denk-Tokens und sechs Aktionen sind zu langsam für die Runde. ✅ Wenige, frühe und richtige Aktionen führen zum Sieg, denn der Gewinner lief mit etwa 13 Aktionen pro Minute. Prüft jede Agentenarchitektur mit diesem Raster: ``` Ebene 1 (Minutentakt, Welt wartet): Planung → Denkmodell Ebene 2 (Sekunden, Welt wartet nicht): Reaktion → Reflex-Code Erste Frage: Wartet meine Welt, während das Modell nachdenkt? ``` Im Echtzeitbetrieb zeigen sich drei Fehlermuster: Die Antwort folgt erst nach dem Reasoning-Absatz, sie gilt einer Welt, die es nicht mehr gibt, und Unteragenten ohne geteilten State sterben nacheinander. Misst statt zu vermuten: 10,5 $ gegen 0,30 $ je Partie bedeuten das 30-Fache an Kosten für dieselbe Klasse. Bei Context Studios bauen wir Agenten zweischichtig: Das Denkmodell gibt den Takt vor, Reflexe laufen als Code, und ein gemeinsamer State dient als Gehirn. #AIAgents #ContextStudios
-
-
Vier Tage, 24 Stunden, zwei Preise. DeepSeek V4 Pro: 1,6 Billionen Parameter, 8,40 $ je 1.000 Runden, 500 Slots. Das Modell wurde als Flaggschiff nach vier Tagen ersetzt und nach 24 Stunden zurückgeholt. Die Serie selbst war der Testlauf. DeepSeek V4.1 Flash stellt 2.500 Slots bereit, kostet 1,80 $ pro 1.000 Runden, erreicht 222 Token pro Sekunde und erzielt 74,2 Punkte. Diese Wahl trägt Volumen im Agenten-Alltag, wobei der Preis 4,7-mal niedriger liegt. ❌ Nur die Benchmark-Tabelle lesen und das teuerste Modell nehmen. ✅ Eigene Aufgaben als Testbank messen, dann nach klaren Grenzen wechseln. Kopierbare Entscheidungsregel: „1. Mit Flash starten, die 2.500 Slots genügen für den Durchsatz. 2. Ein bis drei eigene Aufgaben als feste Testbank messen, denn die Tabelle gilt nur für den Moment. 3. Zu Pro nur wechseln, wenn Kontextlänge oder Beweislage es erzwingt; den Serienstand notieren, weil er sich schnell ändert." Quelle: https://lnkd.in/d9PXBb7t #KI #Agenten
-
Lokale KI-Inferenz zerlegt sich in zwei Phasen, was den Kaufcheck erleichtert. Der Prefill liest den kompletten Input, bevor das erste Token fällt. Bei 8.500 Kontext-Tokens und einem 35B-Modell macht er 94 % der Verarbeitungszeit aus (berichtet, M1 Max). Die bekannte Token/s-Zahl beschreibt nur die Decode-Phase, die 6 % des Erlebnisses erklärt. ❌ Nur die Token/s-Zahl zweier Boxen vergleichen. ✅ Erst den eigenen Workload messen, dann die Hardware wählen. So trägt der Check: „1) typische Prompt-Länge in Tokens zählen, 2) Zeit bis zum ersten Token messen – sie gehört fast ganz dem Prefill, 3) Modelltyp prüfen: bei MoE-Modellen schrumpft der Bandbreitenvorsprung der Referenzbox auf 25 %, bei dichten Modellen sind es 2,26× – 4) Preisabstand gegen die Tuning-Schritte rechnen: die AMD-Box liegt 1.400 $ zurück und hält nach vier Schritten mit (gemessen ~212 von 256 GB/s)." Kontext Studios – Future-Proof Digital Engineering.
-