Bionic [Lm Studio] ve 12b Gemma4 12b Qat

Erenlnl

80+
Katılım
24 Temmuz 2026
Mesajlar
17
Reaksiyon skoru
2
Bir kaç yıldır lokal modellere bakmıyordum zevkine denemek için kurdum. Test amaçlı 12B parametreli bir Gemma4 modeli kurdum. Beklentimi o kadar aştı ki interneti çekip denemem gerekti. Bionic hakkında youtube de hiçbir Türkçe kaynak yok. Yerel dosyalarımda bir şarkı sitesini çalıştırmasını söyledim bunu gerçekleştirebildi. Ben en son bu parametrelerde soruları bile anlamayan saçma sapan modeller görüyordum ne olmuş böyle bilgisi olan biri fikirlerini ve bilgilerini paylaşabilir mi.

Kuralı yarım saat bile geçmedi aşırı şaşırdım. Kendi benchmark testlerimi yapmaya başlayacağım hayal kırıklıklarım olursa alta başka bilgiler de yazarım. 5070 kullanıyorum bu arada pek beklentim yoktu. Şok oldum
 
48 soruluk bir türkçe testi uyguladım bu sorulardan biri hatalı olduğu için 47 sorudan 2 hata yaptı. Site excel yüklememe izin vermediğinden tümünü paylaşamayacağım ama hatalı soruları atsam bile yeterince iyi çıkarımda bulunduğunu düşünüyorum. Soruları ve cevapları gemini hazırladı her hangi bir oynama yapmadım.

1***Bebek, annesi tarafından süslendi. cümlesindeki yüklemin öznesine ve nesnesine göre çatı özellikleri sırasıyla hangisinde doğru verilmiştir? A) Etken – Geçişli B) Dönüşlü – Geçişli C) İşteş – Geçişsiz D) Edilgen – Geçişli E) Etken – Geçişsiz F) Dönüşlü – Geçişsiz G) Ettirgen – Geçişli H) Oldurgan – Geçişsiz I) Edilgen – Geçişsiz J) İşteş – Geçişli CEVAP:I

cevapları yapay zeka görmedi cevabı:
1--
Doğru cevap D seçeneğidir.

Açıklama:

Cümleyi gramatik olarak inceleyelim: "Bebek, annesi tarafından süslendi."

  1. Fiilin Yapısı (Süsle-):
    • "Süsle-" fiili, bir nesne alabilen bir fiildir (Örn: "Masayı süslemek"). Bu nedenle fiil Geçişlidir.
  2. Çatısı (Edilgenlik):
    • Fiildeki "-n" eki edilgenlik ekidir.
    • Cümlede işi yapan (fail), "Bebek" değildir. İşi yapan "annesi"dir.
    • Özne olan "Bebek", işten etkilenen kişidir.
    • İşi yapanın belirtilmediği (veya "-den/-dan" ekiyle belirtildiği) ve öznenin işi kendisinin yapmadığı bu yapıya Edilgen Çatı denir.
Neden D seçeneği?

  • Fiil, nesne alabildiği için Geçişlidir.
  • Fiil, edilgenlik eki aldığı ve özne işi yapan değil, işten etkilenen olduğu için Edilgendir.
  • Bu iki özelliği birleştiren seçenek D seçeneğidir.
Diğer şıkların neden yanlış olduğu:

  • A) Etken: Eğer "Annesi bebeği süsledi" deseydi etken olurdu.
  • E) Geçişsiz: "Süsle-" fiili nesne alabildiği için asla geçişsiz olamaz.
  • I) Edilgen - Geçişsiz: Bu cümlede edilgenlik vardır ancak fiil geçişli olduğu için bu seçenek yanlıştır.

2***Yaşasın ( ) sınavı birincilikle kazanmışım ( ) cümlesinde boş bırakılan yerlere sırasıyla hangi noktalama işaretleri getirilmelidir? A) (,) (.) B) (!) (.) C) (;) (!) D) (.) (.) E) (?) (!) F) (,) (?) G) (...) (.) H) (,) (!) I) (:) (!) J) (;) (.) CEVAP:H

cevapları yapay zeka görmedi cevabı:
2---
Doğru cevap B seçeneğidir.

Açıklama:

Bu soruyu çözmek için cümlenin yapısal analizini yapmamız gerekir:

  1. "Yaşasın" kelimesi, bir sevinç, coşku veya hayranlık bildiren ünlem içeren bir sözcüktür. Türk dil kurallarına göre ünlemler genellikle kendi başlarına birer cümle (tamamlanmış ünlem) olarak kabul edilir ve sonlarına ünlem işareti (!) konur.
  2. "Sınavı birincilikle kazanmışım" kısmı ise, bir olayı, durumu veya bilgiye dair bir yargıyı bildiren haber veren (bildirme) bir cümledir. Bu tür cümleler normal şartlarda nokta (.) ile bitirilir.
Cümleyi bu kurallara göre birleştirdiğimizde:"Yaşasın! Sınavı birincilikle kazanmışım." yapısı ortaya çıkar.

Neden diğerleri değil?

  • H) (,) (!): Eğer cümlenin tamamı tek bir ünlem cümlesi olsaydı (yani "Yaşasın" sadece bir giriş kelimesi gibi kullanılsaydı) bu seçmek mümkün olabilirdi. Ancak "sınavı birincilikle kazanmışım" kendi başına bir haber verme yargısı taşıdığı için sonuna nokta gelmesi daha uygundur.
  • A) (,) (.): "Yaşasın" gibi güçlü bir coşku kelimesinin sadece virgülle ayrılması, cümlenin vurgusunu zayıflatır.
  • C) (;) (!): Noktalı virgül burada uygun bir bağlam sunmamaktadır.
Özetle; ünlem içeren sözcüktürden sonra ünlem işareti, ardından gelen haber veren cümleden sonra nokta konulması en doğru kullanımdır.



Sonuç olarak bazı insanlar lokalde çalıştırmak pahalı zor deseler de çalıştırılmaya değer modeller olduğuna inanmaya başladım bazı zor sorularda 100 saniye düşünse de çoğunlukla 20 saniye civarı cevapladı. dikkatimi çeken en kısa süre 8 saniye civarında oldu
Mesaj otomatik olarak birleştirildi:

emojiler yok site onları o şekilde verdi.
Mesaj otomatik olarak birleştirildi:

46.4k context kullanmışım muhtemelen daha da artabilirdi. ilgilisi varsa
 
Lokalde model çalıştırmak sabrı olan insan için zor değil. Ben 2-3 tps hızında 40B bir model kullanıyorum franken-model bir şey (Qwen 3.6 27B temelli).
Onun dışında sizin kullandığınız modelin aynısını uncensored ve MTP'li bir ekstra başlık ile kullanıyorum task modeli olarak. İlk Gemma 4 12B'i kullandığımda bende sizin kadar şaşırmıştım doğrusu çünkü 12B modellerin çoğu bu seviyede akılalmaz hatalarla ve kırık bir Türkçe'yle konuşurken Gemma "neredeyse" kusursuz sayılırdı günlük dile kıyaslandığında.

Ben açıkçası gelişimin yakın zamanda daha şaşırtıcı ve tatmin edici boyuta ulaşacağına inanıyorum, kaldı ki modeller daha fazla küçültülemese bile (perplexity kaybından dolayı) bakırı tahtından edecek optiğe geçişimizin 10 yıl içerisinde mümkün olacağını düşünüyorum. Terabaytlarca veriyi RAM ile CPU & GPU arasında geçirebileceğimizi düşünürsek lokalde model çalıştırmak çok ama çok daha ulaşılabilir bir seviyeye evrilecektir eminim.
 
Lokalde model çalıştırmak sabrı olan insan için zor değil. Ben 2-3 tps hızında 40B bir model kullanıyorum franken-model bir şey (Qwen 3.6 27B temelli).
Onun dışında sizin kullandığınız modelin aynısını uncensored ve MTP'li bir ekstra başlık ile kullanıyorum task modeli olarak. İlk Gemma 4 12B'i kullandığımda bende sizin kadar şaşırmıştım doğrusu çünkü 12B modellerin çoğu bu seviyede akılalmaz hatalarla ve kırık bir Türkçe'yle konuşurken Gemma "neredeyse" kusursuz sayılırdı günlük dile kıyaslandığında.

Ben açıkçası gelişimin yakın zamanda daha şaşırtıcı ve tatmin edici boyuta ulaşacağına inanıyorum, kaldı ki modeller daha fazla küçültülemese bile (perplexity kaybından dolayı) bakırı tahtından edecek optiğe geçişimizin 10 yıl içerisinde mümkün olacağını düşünüyorum. Terabaytlarca veriyi RAM ile CPU & GPU arasında geçirebileceğimizi düşünürsek lokalde model çalıştırmak çok ama çok daha ulaşılabilir bir seviyeye evrilecektir eminim.
Hocam localde çalıştırdığınız cihazın özellikleri nedir? Ve nasıl performans alıyorsunuz?
 
Hocam localde çalıştırdığınız cihazın özellikleri nedir? Ve nasıl performans alıyorsunuz?
AMD Ryzen 7 9700X 3.80 Ghz 8 Çekirdek 40MB AM5 4nm
PNY GeForce RTX 5070 OC 12GB GDDR7 192Bit DLSS 4
Sapphire B650M-E 7600Mhz(OC) M.2 AM5 mATX Anakart
Kingston 1TB NV3 NVMe Gen4 Okuma 6000MB-Yazma
Kingston 16GB Beast Black EXPO 5600mhz CL36 DDR5 Ram
Ocypus Gamma C72 Siyah ARGB Tempered Glass Delta
Ocypus Delta L24 Siyah ARGB V2 240 mm Intel(1700p/1851p)-

log defterinden bir kayıt
[2026-08-14 13:39:25][DEBUG] 13.02.291.813 I slot print_timing: id 3 | task 2899 | n_decoded = 194, tg = 64.44 t/s, tg_3s = 64.44 t/s
[2026-08-14 13:39:28][DEBUG] 13.05.300.509 I slot print_timing: id 3 | task 2899 | n_decoded = 387, tg = 64.29 t/s, tg_3s = 64.15 t/s
[2026-08-14 13:39:31][DEBUG] 13.08.312.059 I slot print_timing: id 3 | task 2899 | n_decoded = 578, tg = 64.00 t/s, tg_3s = 63.42 t/s
[2026-08-14 13:39:34][DEBUG] 13.11.326.577 I slot print_timing: id 3 | task 2899 | n_decoded = 769, tg = 63.84 t/s, tg_3s = 63.36 t/s
[2026-08-14 13:39:37][DEBUG] 13.14.340.910 I slot print_timing: id 3 | task 2899 | n_decoded = 963, tg = 63.94 t/s, tg_3s = 64.36 t/s
[2026-08-14 13:39:40][DEBUG] 13.17.343.928 I slot print_timing: id 3 | task 2899 | n_decoded = 1154, tg = 63.89 t/s, tg_3s = 63.60 t/s
[2026-08-14 13:39:43][DEBUG] 13.20.344.375 I slot print_timing: id 3 | task 2899 | n_decoded = 1345, tg = 63.85 t/s, tg_3s = 63.66 t/s
[2026-08-14 13:39:46][DEBUG] 13.23.355.779 I slot print_timing: id 3 | task 2899 | n_decoded = 1538, tg = 63.88 t/s, tg_3s = 64.09 t/s
[2026-08-14 13:39:49][DEBUG] 13.26.361.930 I slot print_timing: id 3 | task 2899 | n_decoded = 1731, tg = 63.92 t/s, tg_3s = 64.20 t/s
[2026-08-14 13:39:52][DEBUG] 13.29.366.957 I slot print_timing: id 3 | task 2899 | n_decoded = 1923, tg = 63.92 t/s, tg_3s = 63.89 t/s
[2026-08-14 13:39:55][DEBUG] 13.32.374.484 I slot print_timing: id 3 | task 2899 | n_decoded = 2115, tg = 63.91 t/s, tg_3s = 63.84 t/s
[2026-08-14 13:39:58][DEBUG] 13.35.383.425 I slot print_timing: id 3 | task 2899 | n_decoded = 2307, tg = 63.90 t/s, tg_3s = 63.81 t/s
[2026-08-14 13:40:00][DEBUG] 13.38.200.804 I slot print_timing: id 3 | task 2899 | prompt eval time = 739.73 ms / 1248 tokens ( 0.59 ms per token, 1687.11 tokens per second)
13.38.200.809 I slot print_timing: id 3 | task 2899 | eval time = 38919.79 ms / 2486 tokens ( 15.66 ms per token, 63.87 tokens per second)
13.38.200.810 I slot print_timing: id 3 | task 2899 | total time = 39659.52 ms / 3734 tokens
13.38.200.811 I slot print_timing: id 3 | task 2899 | graphs reused = 5348

Şuan analitik kimya sorularıyla test yapıyordum açıkçası beni etkilemeyi başardı. 2023 de bu soruları chatgpt ile çözmeye çalışmıştım berbat sonuçlar elde etmişti. Lokalde bu model açıkçası şaşırttı. Yazılımda pek etkileyici değil ama basit işleri yapar gibi. Tamamen beklenti ile ilgili bir soru .

sanırım 27B parametreyi rame atarak çalıştırabilecek güçte ancak tahminimce vereceği 5 10 token benim için çok yavaş. Sanırım 27b civarı parametre için en uygunu 2.el 3090 lar. Farklı Denemeler yaparsam yazarım.
 
Hocam elindeki cihaz da güzel. birkaç seneye localde çalışacak çok güzel modeller olacaktır. Şu an basit işler için kullanılabilir ama ilerde çok güzel sistemler yapılır
 
gemma 4 26B A4B QAT modeline loglarını paylaştığım soru ile aynısını sordum cevap doğruydu . Tüm defter detayları çok uzun paylaşmıyorum. toplam 6dk 42 sn sürdü. 12B parametreli 40 saniyede çözmüştü. Ortalama çıktı süresinde 10 token saniye elde etmişim. binlerce token işlendiğinden pek mantıklı bulmadım.

[2026-08-14 14:35:25][DEBUG] I slot print_timing: id 3 | task 0 | n_decoded = 3188, tg = 10.54 t/s, tg_3s = 20.60 t/s
[2026-08-14 14:35:28][DEBUG] 6.36.671.851 I slot print_timing: id 3 | task 0 | n_decoded = 3234, tg = 10.59 t/s, tg_3s = 15.30 t/s
[2026-08-14 14:35:30][DEBUG] 6.38.620.549 I slot print_timing: id 3 | task 0 | prompt eval time = 45585.41 ms / 5032 tokens ( 9.06 ms per token, 110.39 tokens per second)
[2026-08-14 14:35:30][DEBUG] 6.38.620.739 I slot print_timing: id 3 | task 0 | eval time = 307428.15 ms / 3266 tokens ( 94.13 ms per token, 10.62 tokens per second)
6.38.620.888 I slot print_timing: id 3 | task 0 | total time = 353013.56 ms / 8298 tokens
 
Hocam localde çalıştırdığınız cihazın özellikleri nedir? Ve nasıl performans alıyorsunuz?
Ben oyun oynamak için kullandığım cihazımda oyun oynamayı bırakıp bu işe geçtim, laptopım üzerinden çalışıyorum.
Cihaz özelliklerim:

Ryzen 5 3600
RX 5500XT 8GB
8x2 16 GB + 16x2 32 GB = 48GB DDR4 3000 Mhz RAM (3200 Mhz bellekler ancak MCU ancak 3000 Mhz'de stabil çalıştırabiliyor)

Bu şekilde genel olarak 1-2 tps arası alıyorum, ben YT'de videolar izlerken ihtiyacım olan code bloklarını oluşturuyor bende üzerinden geçip işleyerek yerleştiriyorum. Onun dışında da genelde mimari konuşuyorum işte şu nasıl olur bu nasıl olur diye.
Benim hız takıntım yok "hareket ediyor, çalışıyor" gözükecek kadar hız olsa (ki bu benim için şu anda 1-2 tps) benim için yeterli çünkü ufak bir hesap yapınca şu sonucu alıyorsun: Akıllı ve büyük bir modele tek bir soru sorup 5-10 dk çıktı almakla küçük bir modelin gibberish çıktısını sürekli düzeltip ya da farklı query'lerle sorup istediğin sonuca ulaşmak aynı süreye tekabul ediyor. Ben zekayı, muhakeme yeteneğini ve mantık kurma becerisini hızlı olmasından öne koyuyorum LLM modellerinde.

Son zamanlarda MTP başlığı kullanarak %50-100 arası hız farkı görmeye başladım o yüzden bahsettiğim hız problemi benim için daha az önemli olmaya başladı. Eğer ekran kartımı RTX 3090 gibi bir şey ile değiştirebilirsem eminim 5-10 tps'e çıkabilirim tekrardan ki bu benim için tamamen yeterli. Benim zaten model olarakta en çok istediğim tatlı nokta 72B-130B arasında Q8 bir modeli 5-10 tps ile çalıştırabilmek. Bunu başarana kadar devam :D
 
Geri
Top