Normal bir anakartın varsa 2 den fazla güçlü kartı aynı anakarta takamazsın ki, o da Z/X serisi bazı anakartlarda var sadece yoksa tek ekran kartı çoğu. Zaten sorun anakartta da değil normal işlemciler o kadar veri girişine sahip değil.
İş sınıfı anakartlarda (Threadripper, Xeon takılan üst seviye soketler) 3-4 tane oluyor onları hariç tutuyorum.
Normal bir anakartın varsa 2 den fazla güçlü kartı aynı anakarta takamazsın ki, o da Z/X serisi bazı anakartlarda var sadece yoksa tek ekran kartı çoğu. Zaten sorun anakartta da değil normal işlemciler o kadar veri girişine sahip değil.
İş sınıfı anakartlarda (Threadripper, Xeon takılan üst seviye soketler) 3-4 tane oluyor onları hariç tutuyorum.
vrame sığacak tek bir modeli kullanırsan pci 3.0 x1 bile iş görüyor 50-100 mb/sn felan iletişim oluyor
modeli 2-3 ekran kartına böleceksen sıkıntı orada kendi aralarında haberleşeceklerinden hız şart bendeki diğer slotlar gen4 x4 törpülüyor ama işimi görüyor işsiz fakirin yapay zekası bu kadar
nvidia + nvidia veya amd + amd olmalı nvidia + amd oluyorda token ciddi düşüyor
245K
NZXT N7 Z890
64 GB RAM
1 x 5070 12 gb
1 x 4060 ti 16 gb
1 x 3060 12 gb
5070 12 gb ve 3060 12 gb ornith 1.5 35b moe çalıştırıyor 60-70 token civarı oluyor 4060 ti 16 gb olursa 90-110 token arası
4060 ti 16 gb görüntü oluşturma için kullanacağım kasa gelince takacağım
ornith 1.5 35b moe 200 farklı siteden haberleri çevirip 11 tane farklı kategorideki bilim sanat tarih v.s. siteme türkçe çeviri + rewrite yapıyor
çeviride en iyi model bu ornith 1.5 9b'de iş görür rinex20/transIategemma3:12b diğer bir alternatif
işsiz kaldıktan sonra bunun üzerinde çalışmaya başladım pek tutmadı
Mesaj otomatik olarak birleştirildi:
vrame sığacak tek bir modeli kullanırsan pci 3.0 x1 bile iş görüyor 50-100 mb/sn felan iletişim oluyor
modeli 2-3 ekran kartına böleceksen sıkıntı orada kendi aralarında haberleşeceklerinden hız şart bendeki diğer slotlar gen4 x4 törpülüyor ama işimi görüyor işsiz fakirin yapay zekası bu kadar
nvidia + nvidia veya amd + amd olmalı nvidia + amd oluyorda token ciddi düşüyor
VRAMe sığacak tek model olursa çoklu ekran kartının pek anlamı kalmıyor bence, o işin asıl olayı toplam VRAMi arttırma yoluyla büyük modelleri çalıştırmak normalde ama dediğin şekilde işine yarayacaksa olabilir.
245K
NZXT N7 Z890
64 GB RAM
1 x 5070 12 gb
1 x 4060 ti 16 gb
1 x 3060 12 gb
5070 12 gb ve 3060 12 gb ornith 1.5 35b moe çalıştırıyor 60-70 token civarı oluyor 4060 ti 16 gb olursa 90-110 token arası
4060 ti 16 gb görüntü oluşturma için kullanacağım kasa gelince takacağım
ornith 1.5 35b moe 200 farklı siteden haberleri çevirip 11 tane farklı kategorideki bilim sanat tarih v.s. siteme türkçe çeviri + rewrite yapıyor
çeviride en iyi model bu ornith 1.5 9b'de iş görür rinex20/transIategemma3:12b diğer bir alternatif
işsiz kaldıktan sonra bunun üzerinde çalışmaya başladım pek tutmadı
Mesaj otomatik olarak birleştirildi:
vrame sığacak tek bir modeli kullanırsan pci 3.0 x1 bile iş görüyor 50-100 mb/sn felan iletişim oluyor
modeli 2-3 ekran kartına böleceksen sıkıntı orada kendi aralarında haberleşeceklerinden hız şart bendeki diğer slotlar gen4 x4 törpülüyor ama işimi görüyor işsiz fakirin yapay zekası bu kadar
nvidia + nvidia veya amd + amd olmalı nvidia + amd oluyorda token ciddi düşüyor
245K
NZXT N7 Z890
64 GB RAM
1 x 5070 12 gb
1 x 4060 ti 16 gb
1 x 3060 12 gb
5070 12 gb ve 3060 12 gb ornith 1.5 35b moe çalıştırıyor 60-70 token civarı oluyor 4060 ti 16 gb olursa 90-110 token arası
4060 ti 16 gb görüntü oluşturma için kullanacağım kasa gelince takacağım
ornith 1.5 35b moe 200 farklı siteden haberleri çevirip 11 tane farklı kategorideki bilim sanat tarih v.s. siteme türkçe çeviri + rewrite yapıyor
çeviride en iyi model bu ornith 1.5 9b'de iş görür rinex20/transIategemma3:12b diğer bir alternatif
işsiz kaldıktan sonra bunun üzerinde çalışmaya başladım pek tutmadı
Mesaj otomatik olarak birleştirildi:
vrame sığacak tek bir modeli kullanırsan pci 3.0 x1 bile iş görüyor 50-100 mb/sn felan iletişim oluyor
modeli 2-3 ekran kartına böleceksen sıkıntı orada kendi aralarında haberleşeceklerinden hız şart bendeki diğer slotlar gen4 x4 törpülüyor ama işimi görüyor işsiz fakirin yapay zekası bu kadar
nvidia + nvidia veya amd + amd olmalı nvidia + amd oluyorda token ciddi düşüyor
VRAM kullanımı yalnızca modelin ağırlıklarıyla sınırlı değil. Context length, KV cache, modelin düşünme sürecinde oluşturduğu ara veriler ve üretilen tokenlar da VRAM tüketiyor. Bunların tamamı VRAM'e sığdığı sürece CPU'ya bellek taşması veya model hesaplamalarını devretme ihtiyacı ortadan kalkar.
GPU hesaplamaları, bellek yönetimi ve veri aktarımı doğru yapılandırılırsa CPU kullanımı neredeyse minimum seviyeye indirilebilir. Böylece CPU, AI hesaplamalarından ziyade sistemin ve iş akışının koordinasyonunu üstlenir.
Asıl hedef, AI'ı CPU merkezli bir yapıdan çıkarıp GPU merkezli, mümkün olduğunca bağımsız bir mimariye dönüştürmek olmalı. Zaten cpuya çok taştımı ciddi token kaybediyorsun.
Benim CPU ve RAM kullanımımın yüksek olmasının asıl nedeni, 20–30 siteyi aynı anda taramam, haberleri toplamam ve işlemem. Bu yük, yapay zekâdan değil, eş zamanlı web tarama ve veri işleme süreçlerinden kaynaklanıyor.
Diğer insanların Xeon veya AMD Threadripper gibi işlemciler kullanması da her zaman yapay zekâ hesaplama gücüyle ilgili değil. Çok sayıda ekran kartı bağlamak için gereken PCIe yuvası ve PCIe hatları önemli bir etken. Bu tür platformlar, uygun anakartlarla yedi veya daha fazla fiziksel PCIe x16 yuvası sunabiliyor; ancak yuvaların fiziksel x16 olması, hepsinin elektriksel olarak x16 hızında çalıştığı anlamına gelmiyor pci 5.0 x8 olsa yetiyor.
VRAM kullanımı yalnızca modelin ağırlıklarıyla sınırlı değil. Context length, KV cache, modelin düşünme sürecinde oluşturduğu ara veriler ve üretilen tokenlar da VRAM tüketiyor. Bunların tamamı VRAM'e sığdığı sürece CPU'ya bellek taşması veya model hesaplamalarını devretme ihtiyacı ortadan kalkar.
GPU hesaplamaları, bellek yönetimi ve veri aktarımı doğru yapılandırılırsa CPU kullanımı neredeyse minimum seviyeye indirilebilir. Böylece CPU, AI hesaplamalarından ziyade sistemin ve iş akışının koordinasyonunu üstlenir.
Asıl hedef, AI'ı CPU merkezli bir yapıdan çıkarıp GPU merkezli, mümkün olduğunca bağımsız bir mimariye dönüştürmek olmalı. Zaten cpuya çok taştımı ciddi token kaybediyorsun.
Benim CPU ve RAM kullanımımın yüksek olmasının asıl nedeni, 20–30 siteyi aynı anda taramam, haberleri toplamam ve işlemem. Bu yük, yapay zekâdan değil, eş zamanlı web tarama ve veri işleme süreçlerinden kaynaklanıyor.
Diğer insanların Xeon veya AMD Threadripper gibi işlemciler kullanması da her zaman yapay zekâ hesaplama gücüyle ilgili değil. Çok sayıda ekran kartı bağlamak için gereken PCIe yuvası ve PCIe hatları önemli bir etken. Bu tür platformlar, uygun anakartlarla yedi veya daha fazla fiziksel PCIe x16 yuvası sunabiliyor; ancak yuvaların fiziksel x16 olması, hepsinin elektriksel olarak x16 hızında çalıştığı anlamına gelmiyor pci 5.0 x8 olsa yetiyor.