Pengujian Anda lulus pada hari Senin: masukan sama, kode sama, temperature=0. Pada hari Selasa, pengujian gagal tanpa perubahan kode. Assertion membandingkan string persis sama, tetapi model mengembalikan jawaban dengan sedikit perbedaan kata. Rangkaian pengujian menjadi merah, agen sebenarnya baik-baik saja, dan Anda akhirnya men-debug pengujian alih-alih produk.

Coba Apidog hari ini

Ini adalah biaya dari setiap pengujian yang memanggil model bahasa. Output dapat berubah bahkan saat suhu diatur ke nol. Sebagian besar tim akhirnya menulis ulang strategi pengujian mereka: jangan menguji kata-kata yang persis sama, tetapi uji kontrak yang tetap stabil. Panduan ini membahas mode kegagalan ketiga dari panduan tentang mengapa agen AI rusak dalam produksi.

Mengapa temperature=0 tidak berarti deterministik

Suhu mengontrol cara model memilih token berikutnya. Pada temperature=0, model memilih token dengan probabilitas tertinggi. Secara intuitif, hasilnya terlihat seharusnya dapat direproduksi, tetapi kenyataannya tidak selalu demikian.