İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF)

3.565 kayıtlı öğrenci
Büyük dil modelleri (LLM'ler) insan tarafından üretilen metinler üzerinde eğitilir, ancak bir LLM'i insan değerleri ve tercihleriyle uyumlu hale getirmek için ek yöntemlere ihtiyaç duyulur. İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF), şu anda LLM'leri insan değerleri ve tercihleriyle uyumlu hale getirmek için kullanılan temel yöntemdir. RLHF, temel bir LLM'i kendi kullanım senaryonuza özel değer ve tercihlerle uyumlu hale getirmek amacıyla daha fazla ince ayar (tuning) yapmak için de kullanılır. Bu kursta, RLHF eğitim sürecini kavramsal olarak anlayacak ve ardından bir LLM'e ince ayar yapmak için RLHF uygulaması yapacaksınız. Şunları yapacaksınız: 1. RLHF eğitiminde kullanılan iki veri kümesini ("tercih" ve "istem" veri kümeleri) keşfedeceksiniz. 2. Llama 2 modeline RLHF ile ince ayar yapmak için açık kaynaklı Google Cloud Pipeline Components kütüphanesini kullanacaksınız. 3. Kayıp eğrilerini karşılaştırarak ve "Side-by-Side (SxS)" yöntemini kullanarak ince ayar yapılmış LLM'i orijinal temel modele göre değerlendireceksiniz.
SERTİFİKAKatılım Sertifikası
FORMAT%100 Online
SÜREKendi hızında

Detaylar

  • SağlayıcıDeepLearning.AI
  • TürKurs
  • KategoriYazılım & Programlama
  • Dilİngilizce

Öğrenenlerimiz ne diyor?

Türkiye'nin yüz akı üniversitelerince hazırlanan; akademik doyuruculuğa sahip eğitim içeriklerinin, etkileşimli videolarla bir araya getirildiği bir üniversiteden eğitim almak istiyorsanız doğru yerdesiniz.
Ramazan Bölükbaşı
Çok yoğun programı olan öğrenciler için büyük bir fırsat. Bir şeylerin gelişmesi değişmesi için çabalamalıyız.
Melis Gülsar
Hızlı desteği ve üst düzey hizmeti ile Campus Online ve Sosyal Medya Sertifika Programı hizmeti sağlayan Adnan Menderes Üniversitesine sonsuz teşekkürlerimi sunuyorum.
Nazif Bayram
$49
CampusOnline Yardımcı asistan
kurs kaydedildi

Kurs Karşılaştırma

Kurum
Puan
Türkçe Altyazı
Seviye
Süre
Fiyat
Sertifika