Ajan Bellegi Altyapi Oluyor: Context Engineering Devrimi ve 3 Katmanli Bellek
2026'da yapay zeka ajanlarinin en kritik mühendislik problemi, model degil, bellek. "Prompt engineering" (komut muhendisligi) dönemi bitti; "context engineering" (baglam muhendisligi) dönemi basladi. Bir ajanin ne hatirladigi, neyi unuttugu ve neyi ne zaman geri getirdigi, üretim kalitesini belirleyen en önemli faktör haline geldi.
Peki, ajan bellegi neden altyapi sorununa dönüstü, hangi teknolojiler öne çikiyor ve üretimde karsilasilan sorunlar neler?
Context Window Depolama Degildir
En yaygin yanilgi, context window'un (baglam penceresi) bir depolama alani oldugudur. Context window, bir modelin tek bir istekte görebildigi metin miktaridir. Gemini 1M+ token, Claude 200K token seviyelerine ulasti. Bu rakamlar büyük görünse de, üretime alinmis bir ajan için hiç de yeterli degil.
Fountain City Technologies'in üretim deneyimleri, context window'nu depolama olarak kullanan ajanlarin dort sekilde basarisiz oldugunu gösteriyor:
Token sismesi: 2,000 token ile baslayan bir oturum, birkaç değiş-tokuş sonrasi 25,000 token'a ulasir. Modelin dikkati 25,000 token üzerine yayilir ve çikti kalitesi düşer.
Tercih seyrelmesi: Arastirma verilerine göre, ajanlar belirtilen kullanici tercihlerine 5. turda %73 uyurken, 16. turda bu oran %33'e dusuyor. Tercih unutulmuyor; daha çok içerik tarafindan seyreltiliyor.
Oturum ortasi celiskiler: Konusma gectikce ajan, önceki çiktilariyla celisen cevaplar vermeye baslar.
Talimat bozulmasi: Sistem prompt'lari, context büyüdükçe göreli agirligini kaybeder ve ajan davranis kisitlamalarindan uzaklasir.
Cozum, context window'nu RAM gibi ele almaktir: yalnizca bu turda gerekeni tut, gerisini dis katmana ata.
Uc Katmanli Bellek Modeli
Üretim ajanlari için standart bellek mimarisi üç katmanlidir:
Tier 1 - In-context (Baglam ici): Son birkaç tur, mevcut calisma alani ve bu tur için getirilen 5-10 bellek. Context window'da yasar, aninda erisilebilir.
Tier 2 - Vector search (Vektor aramasi): Daha önceki oturumlardan elde edilmis ve vektor veritabaninda saklanan bellekler. Ihtiyac oldukca semantik arama ile geri getirilir. pgvector, PostgreSQL'in vektor arama eklentisi, artik varsayilan seçim.
Tier 3 - Persistent cross-session (Kalici oturumlar arasi): Ajanin kullanici veya proje hakkinda oturumlar arasi hatirladiklari. Yapilandirilmis depolama (SQL), vektor indeks ve framework-specific store'larin bilesimi.
Bu üc katmanli ayrim artik standart baslangiç noktasi. LangChain'in memory concepts dokümantasyonu, kisa vadeli thread-scoped state ile uzun vadeli cross-thread store'lari ayirir. Redis'in dual-tier yaklasimi, kisa vadeli in-memory + durable storage kombinasyonunu kullanir.
Memory Blocks: Adlandirilmis Yapilandirilmis Alanlar
2026'da ortaya çikan önemli bir kavram: memory blocks (bellek bloklari). Bunlar, context window içinde adlandirilmis, yapilandirilmis alanlardir. Ajan, bu bloklari dogrudan okuyup yazabilir.
Letta bu yaklasimin öncüsü. Bir ajanin bellegini üç seviyede düzenler: Core Memory (context window'da, RAM gibi), Recall Memory (aranabilir konusma gecmisi, disk cache gibi) ve Archival Memory (vektor tabanli uzun vadeli depolama). Ajan, Core Memory'yi araç çagrilari (tool calls) araciligiyla dogrudan düzenler. Kullanici bir tercihi düzelttiginde, arka planda bir extraction pipeline beklemesine gerek kalmaz; ajan hemen günceller.
Letta'nin en yenilikci özelligi sleep-time compute (gece boyunca hesaplama). Konusma sirasinda calismayan ikinci bir ajan, kullanici beklerken birincil ajanin Core Memory'sini düzenler: celiskileri çözer, örüntüleri soyutlar, iliskileri ön-hesaplar. Latency yolunda olmadigi için daha büyük ve daha yavas bir model kullanabilir.
Mem0: Pasif Extraction Pipeline
Mem0, farkli bir felsefe benimser. Ajan bellegi düzenlemez; uygulamaya bir boru hatti (pipeline) ekler. Her mesaj çiftinden LLM ile aday gerçekler çikarir, sonra her adayi mevcut belleklerle vektor benzerligi üzerinden karsilastirir ve ADD, UPDATE, DELETE veya NOOP kararini verir.
Mem0'nin gücü, uygulamanin hiçbir sey yapmasina gerek olmamasidir. Pipeline arka planda calisir. Zayifligi ise her yazma isleminin bir LLM çagrisi gerektirmesidir: hem latency maliyeti hem de hata yuzeyi. Kotu bir UPDATE, ajanin sonradan güvenecegi bir gercegi sessizce degistirebilir.
Mem0'nin verimlilik iddiasi çarpici: tam context baseline 25,000+ token kullanirken, Mem0 ortalama 6,900 token ile ayni dogrulugu sagladigini iddia ediyor. Ama bu rakamlarin Mem0'un kendi harness'inde ölçüldügünü unutmamak gerek.
Zep / Graphiti: Zamansal Knowledge Graph
Zep'in open core'u Graphiti, zamansal bir bilgi grafigi insaa eder. Her gercek, bir geçerlilik penceresi (valid_at / invalid_at) ile gelir. Yeni bir bilgi, eski bir gercekle celistiginde, eski gercek silinmez; geçersiz olarak isaretlenir. "Mart ayinda bu musteri hakkinda ne düsünüyorduk ve ne zaman degisti?" sorusu birinci sinif sorgu haline gelir.
Bu özellik, düzenlemeli işler, celiskili kayitlar veya ajan kararlarinin sonradan savunulmasi gereken durumlarda degerlidir. Düzeltmenin geçmisi de hayatta kalir.
Zep'in önemli bir operasyonel detayi var: self-contained Community Edition server deprecated edildi. Open-source yol artik Graphiti + ayri bir grafik veritabani (Neo4j, FalkorDB veya Kuzu) anlamina geliyor. Üç sistem provision etmek gerekiyor.
GraphRAG ve Hibrit Yaklasimlar
GraphRAG (Neo4j tabanli), yükselen bir teknoloji. Bilgi grafigi yaklasimi, çok-adimli (multi-hop) sorularda vektor store'lardan çok daha iyi performans gösterir. "Alice'in referans verdigi müsteri gecten ayi ayrilan müsteri miydi?" gibi sorular, grafik traversi ile dogal bir sorgudur.
2026'da üretim deseni hibrit. Vektor bellek hizli ve bulanik (fuzzy) erisim için, epizodik tampon kisa vadeli süreklilik için ve grafik ise az ama kritik çok-adimli sorular için. Üçünü bir arada kullanmak, operasyonel maliyet getirir ama üretimde en iyi sonucu veriyor.
DRAM Fiyatlari ve Memory Bandwidth
Bellek, sadece yazilim problemi degil; donanim problemi. Ajanlarin context window'lari büyüdükçe, memory bandwidth (bellek bant genisligi) sinirlayici faktör haline geliyor. Bu, DRAM fiyatlari üzerinde yukari yönlü baski olusturuyor.
Gemini'nin 1M+ token context window'u ve Claude'in 200K token'i, model provider'lari için bile bellek yönetimini kritik bir mühendislik sorununa dönüştürdü. Kendi sunucularinizi host ediyorsanız, GPU bellek bant genisligi ajan latansinin sinirlayici faktörü olabilir.
Benchmark Sorunu: Herkes Kendi Sinavini Yapiyor
Ajan bellek dunyasasindaki en büyük problem: güvenilir benchmark olmamasidir. Mem0, Mem0'nun skorlarini yayinlar. Zep, Zep'in skorlarini yayinlar. Letta, Letta'nin üzerinde ölçüldügü leaderboard'u tasarlar.
En çarpiki örnek: Mem0, LongMemEval'da 94.4 puan iddia ediyor. Bagimsiz bir ölçüm (vectorize.io, Mart 2026) ayni benchmark'ta 49.0 puan buldu. Aradaki 45.4 puanlik fark, vendor rakamlarinin kararlara temel olusturamayacagini gösteriyor.
Sonuc: kendi veriniz üzerinde kendi degerlendirmenizi yapin. Bellek kalitesi, verinizin sekline (gerçekler ne siklikta degisiyor, oturumlar ne kadar uzun, ne kadar içerik yapisiz sohbet olarak geliyor) son derece bagimlidir.
Sonuç
Ajan bellegi, 2026'da altyapi sorunu haline geldi. Context window'un depolama degil RAM oldugu, extraction ve retrieval kalitesinin model yeteneginden daha önemli oldugu ve hibrit yaklasimlarin (vektor + epizodik + grafik) üretim standarti haline geldigi bir döneme giriyoruz.
Letta, Mem0 ve Zep üç farkli mimariyi temsil ediyor: ajan-duzenlenen tier'lar, pasif extraction pipeline ve zamansal grafik. Üçü de Apache-2.0 lisansli ve self-hostable. Ama üçü de farkli operasyonel yuk getiriyor.
Benchmark sorunu çözülmediği sürece, vendor rakamlarina güvenmek riskli. Kendi konusmalariniz üzerinde kendi eval'inizi yapmak, bu kategoride yapabileceginiz tek güvenilir ölçum.
Kaynaklar:
- Open-Source Agent Memory: Mem0 vs Letta vs Zep Compared - Digital Applied
- Agent Memory Architectures: Vector vs Graph vs Episodic - Digital Applied
- AI agent memory systems in 2026 - Hivra
- How to Build and Operate AI Agent Memory in 2026 - Fountain City Tech
- Memory Governance Is Becoming the Control Plane for Agentic AI - HackerNoon