Reflection AI, 5 Ekim 2026’da ilk açık ağırlıklı modeli Beam’i tanıttı. Yalnızca metinle çalışan model; kodlama, akıl yürütme ve yapay zekâ ajanlarının görevleri için geliştirildi. Şirket, Beam’i Çin’den ve Batı’dan önde gelen açık modellere alternatif olarak konumlandırıyor. Ancak performans ve verimlilik karşılaştırmaları, model ağırlıkları ve değerlendirme ayrıntıları bağımsız biçimde incelenene kadar şirketin iddiaları olarak görülmeli.
3
7
13
Mimari, eğitim ve bağlam uzunluğu
Beam, seyrek Uzman Karışımı (Mixture-of-Experts, MoE) mimarisine sahip: toplam 501 milyar parametresi var, ancak her token işlenirken yaklaşık 23 milyar parametre etkinleşiyor. Reflection, modeli 23,8 trilyon token üzerinde ön eğitime tabi tuttuğunu ve ardından yoğun hesaplama gerektiren pekiştirmeli öğrenme kullandığını söylüyor. Şirketin duyurusuna göre bu eğitim aşamasında 100 milyondan fazla deneme üretildi.
14
Reflection, model için 1 milyon token’a kadar bağlam penceresi bildiriyor. Bununla birlikte, beta arayüzüne ilişkin üçüncü taraf haberlerinde 256 bin token sınırı aktarılıyor. Dolayısıyla duyurulan model kapasitesiyle belirli bir hizmet üzerinden kullanıcıya sunulan sınır aynı olmayabilir; mevcut bilgiler, beta sınırının tüm kullanımlarda geçerli olduğunu göstermiyor.
3
7
17
18
Kıyaslama sonuçları ne söylüyor?
Reflection, SWE-bench Verified testinde yüzde 80,9 sonuç bildirdi. Terminal-Bench v2.1 için aktarılan ayrı bir karşılaştırmada ise Beam’in 80,1 puanı; GLM-5.2’nin 81,0, Kimi K3’ün 88,3 ve DeepSeek V4.1 Flash’ın 90,6 puanının gerisinde kalıyor. Bu sonuçlar Beam’in bazı görevlerde rekabetçi olabileceğine işaret etse de önde gelen Çinli veya Batılı açık modellerin genel olarak önüne geçtiğini göstermiyor.
12
20
Reflection, ayrıca seçilmiş kıyaslama testlerinde Beam’in GLM-5.2 düzeyinde akıl yürütme performansı gösterdiğini belirtiyor. Şirket, tahmini üretim hesaplama ihtiyacının GLM-5.2’ye kıyasla yaklaşık üç ila dört kat, kendi karşılaştırmalarındaki önde gelen Batılı açık modellere kıyasla ise dört kattan fazla düşük olduğunu iddia ediyor. Bunlar tahminler; her kullanıcının aynı maliyet veya gecikme azalmasını göreceğini kanıtlayan bağımsız ölçümler değil.
13
16
Ağırlıklar bağımsız testlere açılmadığı için kıyaslama sonuçlarını ve hesaplama karşılaştırmalarını şimdilik ön bulgular olarak değerlendirmek gerekiyor. Test düzeni ve hizmetin çalıştırıldığı koşullar modeller arasındaki kıyaslamayı etkileyebilir; açıklanan puanlar, Beam’in diğer görevlerde veya farklı kurulumlarda nasıl performans göstereceğini tek başına ortaya koymuyor.
7
13
Yayın takvimi ve erişim
Reflection, Beam’in ağırlıklarını Apache 2.0 lisansı altında Ekim 2026’nın ilerleyen günlerinde yayımlamayı planlıyor; mevcut kaynaklarda kesin bir tarih verilmiyor. Erken erişim için bekleme listesi sunuluyor. Haberlerde teknik rapor ve model kartı gibi ek materyallerin de yayımlanmasının planlandığı belirtiliyor. Bu belgeler ortaya çıkana kadar paylaşımın kapsamı netleşmiş değil.
2
3
21
Açık ağırlıklar, geliştiricilerin yayımlanan modeli indirip çalıştırmasına ve uyarlamasına imkân verebilir. Ancak bu, modelin belirli bir kurumda kullanıma hazır ve doğrulanmış bir sistem olduğu anlamına gelmiyor. Beam geliştiricilere, işletmelere ve kamu kuruluşlarına yönelik tanıtılıyor; mevcut haberler belirli bir kamu kurumu kullanımını ya da bir kurumun özel verileriyle özelleştirilmiş bir modeli doğrulamıyor.
1
5
31
Reflection AI’ın planlarında Beam’in yeri
Beam’in duyurusu, şirketin geniş ölçekli altyapı yatırımlarıyla birlikte geliyor. Haberlerde Nvidia GB300 sistemlerini kapsayan 6,3 milyar dolarlık bir SpaceX anlaşmasından ve Nebius ile yapılan ayrı bir hesaplama anlaşmasından söz ediliyor. Bu anlaşmalar Reflection’ın hedeflerinin gerektirdiği altyapı ölçeğine işaret ediyor; ancak Beam’in performansını ya da tahmini çıkarım tasarruflarını bağımsız olarak doğrulamıyor.
4
8
Şimdilik Beam’i değerlendirmenin en sağlıklı yolu, açıklanan teknik özelliklerle henüz doğrulanmamış karşılaştırmaları birbirinden ayırmak. Mimari, eğitim ölçeği ve hedeflenen kullanım alanları duyuruldu; modelin rakiplerine kıyasla başarısı ve gerçek kullanım koşullarındaki verimliliği ise ağırlıklar ve daha kapsamlı değerlendirme materyalleri yayımlandığında sınanabilecek.
7
13
14