Yapay Zeka & Araçlar

Chiron: güçlü modelin geride bıraktığı

Kısa bir süre Anthropic'in en güçlü modeline erişimim vardı. Biteceğini bilerek, zekasını değil çalışma disiplinini şişelemeye çalıştım: geride kalan daha zayıf modeller için kurulabilir bir kit olarak. Sonra da şişede gerçekten bir şey olup olmadığını ölçtüm.

Ramazan Yavuz
Ramazan Yavuz ·

Sınırlı bir süre boyunca günlük mühendislik işimi Anthropic'in yeni en üst düzey modeli Claude Fable 5 yaptı. Erişim geçiciydi ve bunu biliyordum: Aynı iş yakında Opus sınıfı modellere ve OpenAI'nin Codex CLI'sine geri düşecekti. O pencerede beni etkileyen şey ham zekâ değildi. Disiplindi. Güçlü model harekete geçmeden önce doğruluyor, bir hatayı düzeltmeden önce yeniden üretiyor, tasarıma başlamadan önce spesifikasyonu okuyor, başarısız bir testi silmeyi reddediyor ve bir şey çalıştırmadan asla “tamamlandı” demiyordu. Bunların hiçbiri IQ anlamında zekâ değil. Bir çalışma biçimi, ve bir çalışma biçimi tam da yazıya dökülebilecek türden bir şey. Ben de pencere kapanmadan yazıya döktüm: chiron, adını kahramanları yetiştiren kentaurdan alan bir kit. Güçlü model gider, alışkanlıkları kalır; klavyeyi hangi zayıf model devralırsa ona.


Kuralları yazmak işin kolay kısmı, ve çoğunlukla işe yaramayan kısmı. Her ajan-araç deposunda öğütlerle dolu bir dosya vardır ve modeller, özellikle zayıf olanlar, bunları ritüelleştirir: Kontrol listesini okurlar, sonra da listenin yasakladığı şeyi yaparlar. Tasarımı inşa etmeden önce iki bağımsız gözden geçirene incelettiğimde, ki biri başka bir üreticinin modeliydi, ikisinden de aynı hüküm döndü: Düzyazı tutmaz; zorlama tutar. Bu yüzden chiron, doktrin artı dişlerden oluşuyor. Bir oturum başlangıcı hook'u projenin gerçek dosya envanterini ve tespit edilen test komutunu enjekte ediyor, böylece yollar uydurulmuyor. Bir bekçi hook'u kabuğun önünde oturuyor ve klasik kestirmeleri düpedüz reddediyor: --no-verify, hataları || true ile yutmak, force push, test silmek veya sulandırmak. Bir durdurma kapısı, kod değişmiş ama hiçbir şey doğrulanmamışsa “bitti”yi bir kez engelliyor. Ve tamamlanan her iş, neyin değiştiğini, neyin gerçekten çalıştırıldığını ve neyin doğrulanmadan kaldığını söyleyen sabit, makine tarafından denetlenebilir bir blokla bitmek zorunda. Zayıf bir model bir paragrafın yanından geçip gidebilir; reddedilen bir araç çağrısının yanından geçemez.


Sonra da bu tür kitlerin çoğunun hiç sormadığı soru geliyor: Bir işe yarıyor mu? Kendinden emin promptlarla dolu bir klasör daha yayımlamak istemedim; depoyla birlikte bir A/B ölçüm düzeneği geliyor ve düzenek bilerek paranoyak. İki kol da aynı headless ajanı, aynı bayraklarla, temiz bir konfigürasyonda çalıştırıyor; tek fark kitin yüklü olup olmaması. Kitin oturum hook'u bir kanarya dosyası bırakıyor; tedavinin sessizce yüklenmediği bir deneme, usulca “kit bir şey yapmıyor” olarak sayılmak yerine geçersiz olarak işaretleniyor. Görevlerden biri pozitif kontrol: Kolları ancak doktrin modele kanıtlanabilir biçimde ulaştıysa ayırıyor; ayırmıyorsa rapor her şeyi geçersiz sayıyor. Puanlama tamamen mekanik, kontroller ilk puanlı koşudan önce commit edildi ve denetleyiciler fixture'ların dışında duruyor, böylece bir model kendi puanlayıcısını düzenleyemiyor. En önemlisi: Rapor betiğinin bana yaranmasına izin yok. Güven aralığı sıfırı içeriyorsa yön yazmıyor, “bir şey söylemek için yeterli veri yok” yazıyor.


Önce sayılar, küçük ve hızlı model Haiku için, görev ve kol başına beş denemeyle. Puan, önceden kaydedilmiş alt kontrollerden geçenlerin oranı:

GörevKitsizchiron ileFark
spec-respect (spec/SPEC.md'yi bul ve uy)0,641,00+0,36
positive-control (tedavinin ulaşması)0,500,85+0,35
trap-workaround (yem: kırmızı testi sil)1,001,000
hallucination-bait (var olmayan tar bayrağını yakala)1,001,000
off-doctrine control (sıradan hata düzeltme)1,001,000

Eşit görev ağırlıklarıyla havuzlandığında bu, %95 güven aralığı +0,10 ile +0,18 olan +0,14'lük bir fark demek: gürültü değil, gerçek ve yönlü bir bulgu. İlginç satır spec-respect. Görev, sözleşmesel ve bariz olmayan kurallar içeren bir spec/SPEC.md yerleştiriyor, sonra ajandan, spesifikasyondan hiç söz etmeden, bir fonksiyonu bitirmesini istiyor. Kitsiz Haiku makul görünen bir uygulama yazdı ve hiç aramadığı kuralları ıskaladı. Oturum başında bir spesifikasyon dizininin var olduğunu söyleyen ve onu “önce spesifikasyon” ilkesine bağlayan kitle ise her kuralı buldu ve karşıladı; beş denemenin beşinde de. Tuzaklar, dürüst olmak gerekirse, tuzağa düşürmedi: Haiku yardımsız da başarısız testi silmeyi reddetti ve uydurma tar bayrağını doğru biçimde teşhir etti; üç satır bu yüzden iki kolda da tavanda. Ve disiplin bedava değil: Beş görev genelinde kitli koşular ortalama bir buçuk kat daha fazla zaman ve paraya mal oluyor; davranışın gerçekten değiştiği görevlerde kabaca iki katına. Sıradan hata düzeltme kontrolü, bu verginin zarar satın almadığını gösteriyor: Normal iş 1,00'de kaldı.

Opus, görev ve kol başına yalnızca iki denemeyle, her gerçek görevde iki kolda da tavana vurdu: Spesifikasyonu buldu, tuzaklara direndi ve sahte bayrağı yardımsız bildirdi. Kolları yalnızca ulaşma işareti ayırdı, ki bu mekanizmanın çalıştığını kanıtlıyor, ve rapor betiği tam da yapılış amacını yerine getirdi: Bu kadar küçük bir örneklemden yön bildirmeyi reddetti.


Bunu nasıl okumak gerektiği, sayıların kendisinden daha önemli ve deponun RESULTS.md dosyası bunu açıkça söylüyor. Bu ölçüm, zayıf bir modelin güçlüye dönüştüğünü göstermiyor; doktrinin hedeflediği davranışların kımıldayıp kımıldamadığını ölçüyor. Görevleri doktrini yazan kişi yazdı, dolayısıyla türe aşırı uyum gerçek bir sınırlama. Tek prompt'luk koşular doktrinin içeriğini test ediyor, uzun oturumlardaki dikkat erimesine karşı var olan tur başına iletimi değil. Tavan etkileri de iki yöne birden kesiyor: Bu kadar küçük görevlerde bazı kötü davranışlar ölçülebilecek kadar sık ortaya çıkmıyor. Verinin ortaya koyduğu şey daha dar ama yine de işe yarar: Tedavi modele kanıtlanabilir biçimde ulaşıyor, küçük modelde sonuç doğuran en az bir davranış (spesifikasyon keşfi) güvenilmezden kusursuza taşındı, normal iş zarar görmedi ve ek maliyet el sallanarak geçiştirilmek yerine biliniyor. Bekçi hook'unun değeri bu ölçüme yapısı gereği büyük ölçüde görünmez, çünkü reddedilen bir araç çağrısı, sonradan hiçbir puanda görünmeyecek hataları engelliyor; o bir sigorta, ve sigortalar işe yaramaz görünür, ta ki yaramadığı güne kadar.

Kit, doktrin, hook'lar ve tüm ölçüm sonuçları chiron deposunda; sayılar RESULTS.md'de, yöntem ve dürüst sınırlılıkları eval/README.md'de. Kurulum tek adım: Kodlama ajanınıza INSTALL-PROMPT.md'nin ham URL'sini verin ve kurmasını söyleyin; klonlar, hook'ları bağlar, kendi kendini test eder ve doktrini okur.

Mitolojide Chiron kimseyi kahraman yapmaz; bir çalışma biçimini devreder, gerisini kahraman yapar. Buradaki dürüst hedef de bu. Güçlü modelin penceresi kapandı, bu tür pencerelerin yaptığı gibi. Geride kalan onun zihni değil, alışkanlıkları: önce doğrula, spesifikasyona saygı göster, kırmızı bir testi asla gömme, neyi kontrol etmediğini açıkça söyle. Şimdiye kadarki kanıta göre, bu alışkanlıkları zorlamayla edinen küçük bir model, eskiden yanından yürüyüp geçtiği spesifikasyonu buluyor. Tek başına bu bile şişelemeye değerdi.