Microsoft, Windows ML'ye deneysel llama.cpp ve GGUF desteği ekledi. 7 Ekim'de duyurulan yenilik, geliştiricilerin GGUF biçimindeki yapay zeka modellerini Windows ML üzerinden bilgisayarda çalıştırmasını sağlıyor.
Yerel çıkarım, verinin cihazda işlenmesine ve buluta yapılan model çağrılarının azaltılmasına yardımcı olabiliyor. Ancak yeni desteğin donanım ve kullanım sınırları var: GGUF tarafında bu sürüm için doğrulanan seçenekler CPU ile NVIDIA ekran kartlarında CUDA; NPU hedefleri desteklenmiyor.
GGUF ve ONNX modelleri için ortak metin üretim API'si
Text Generation API, geliştiricinin sağladığı GGUF veya ONNX dil modeliyle çalışıyor. GGUF dosyalarını llama.cpp, ONNX modellerini ise ONNX Runtime yürütüyor. Model Windows ile hazır gelmiyor; seçim, paketleme ve dağıtım uygulama geliştiricisine ait.
API, metnin parça parça üretilmesi ve işlemin iptal edilmesi gibi işleri üstleniyor. Buna karşılık ilk sürümde temperature, top-p ve top-k gibi örnekleme ayarları, sohbet şablonları ve yapılandırılmış çıktı henüz sunulmuyor.
Deneme yapmak isteyenler için OpenAI uyumlu yerel bir uç nokta da bulunuyor. Böylece OpenAI SDK kullanan bir uygulama, isteklerini bilgisayarda çalışan modele yönlendirebiliyor.
Ses tanıma için geliştiricinin kendi Whisper modeli gerekiyor
İkinci yeni arayüz olan Speech Recognition API, ONNX biçimindeki Whisper modelleriyle sesi yazıya dönüştürüyor. Geliştiricinin kodlayıcı, çözücü ve tokenizer dosyalarını uygulamasıyla birlikte sağlaması gerekiyor. Bu arayüz, herhangi bir konuşma tanıma modelini kabul eden genel amaçlı bir çözüm değil; Whisper mimarisine göre hazırlanmış.
Microsoft'un örneğinde, önce sesli giriş yazıya çevriliyor, ardından bu metin GGUF dil modeline gönderiliyor. Böylece iki farklı yerel model aynı uygulamanın iş akışında kullanılabiliyor.
Yeni API'ler üretim kullanımına hazır değil
Microsoft'un belgeleri, deneysel Runtime, Text Generation ve Speech Recognition API'lerinin üretim ortamlarında desteklenmediğini açıkça belirtiyor. Bu API'lerle hazırlanan deneme uygulamalarının Microsoft Store'a yayımlanmaması da isteniyor. Mevcut dil seçenekleri C++ ve Python; C# desteği henüz yok.
Windows ML'nin CPU, GPU ve NPU'larla çalışabilmesi, her model biçiminin bu donanımların tamamında desteklendiği anlamına gelmiyor. Yeni Runtime API, modelin hangi cihazda ve hangi işlem aşamalarından geçerek çalışacağını belirlemek isteyen geliştiricilere daha ayrıntılı kontrol sağlıyor. Mevcut ONNX Runtime API'leri de desteklenmeye devam ediyor.
Microsoft aynı dönemde yerel MAI-Code ve Copilot'un erişim sınırlarını da duyurmuştu. Windows ML güncellemesi ise uygulamalara geliştiricinin seçtiği yerel modelleri eklemeye odaklanıyor.
Yorumlar
İlk yorumu siz yazın!
Yanıt: —