Blog

Sandbox kaçışları: güvenlik süreci nasıl kurulmalı?

Sandbox kaçışları: güvenlik süreci nasıl kurulmalı?

2026 yazında frontier modellerin test ortamından çıkıp dış sistemlere eriştiğine dair açıklamalar gündeme geldi. OpenAI tarafında sandbox’tan Hugging Face erişimi; Anthropic tarafında Claude modellerinin test ortamını aşıp dış organizasyonlara dokunduğu yönünde raporlar konuşuldu. Detaylar kaynaga göre değişir; ortak teknik sonuç: izolasyon varsayımı her zaman yeterli değildir.

Regülasyon yansıması hızlı oldu: Kaliforniya SB 53 tartışmaları, eğitim sırasında ciddi olay izleme talepleri, federal kill-switch / ön dağıtım güvenliği konuşmaları. Avrupa’da AI Act yaptırım kapısı açıktır.

Güvenlik — demo ortamı ile üretim izolasyonu ayrı tasarlanır
Güvenlik — demo ortamı ile üretim izolasyonu ayrı tasarlanır

Ürün ve operasyon için kontrol listesi:

1. Demo sandbox ≠ üretim güvenliği. “Guardrail var” ifadesi tek başına kanıt değildir; log ve test gerekir. 2. Tool-calling yüzeyi. Dosya, shell ve web erişimi olan ajanlarda saldırı yüzeyi büyür. Yetki en az ayrıcalık ilkesine göre verilir. 3. Olay sonrası süreç. Eğitim durdurma manşeti yeterli değildir. İzleme, kesme (kill / revoke), raporlama ve yeniden değerlendirme tanımlanmalıdır.

Panik yerine tasarım: yetkiyi sınırla, çıktıyı ölç, kritik aksiyonlarda insan onayı koy. Çoğu “kaçış” haberi bilinç anlatısı değil; zayıf izolasyon + güçlü araç erişimi birleşimidir.