Jin10 Data 3 April, pukul 1 pagi, OpenAI Sumber Terbuka sebuah benchmark baru untuk penilaian AI Agent—PaperBench. Benchmark ini terutama menguji kemampuan agen dalam pencarian, pengintegrasian, dan pelaksanaan, yang memerlukan reproduksi dari makalah-makalah terkemuka di konferensi pembelajaran mesin internasional 2024, termasuk pemahaman isi makalah, penulisan kode, serta pelaksanaan eksperimen. Menurut data pengujian yang dirilis oleh OpenAI, saat ini agen yang dibangun oleh model besar yang terkenal, masih belum dapat mengalahkan doktor profesional pembelajaran mesin teratas. Namun, ini sangat membantu dalam pembelajaran pendukung dan memahami konten penelitian.
Halaman ini mungkin berisi konten pihak ketiga, yang disediakan untuk tujuan informasi saja (bukan pernyataan/jaminan) dan tidak boleh dianggap sebagai dukungan terhadap pandangannya oleh Gate, atau sebagai nasihat keuangan atau profesional. Lihat Penafian untuk detailnya.
OpenAI Sumber Terbuka PaperBench, membentuk kembali evaluasi Agen AI teratas
Jin10 Data 3 April, pukul 1 pagi, OpenAI Sumber Terbuka sebuah benchmark baru untuk penilaian AI Agent—PaperBench. Benchmark ini terutama menguji kemampuan agen dalam pencarian, pengintegrasian, dan pelaksanaan, yang memerlukan reproduksi dari makalah-makalah terkemuka di konferensi pembelajaran mesin internasional 2024, termasuk pemahaman isi makalah, penulisan kode, serta pelaksanaan eksperimen. Menurut data pengujian yang dirilis oleh OpenAI, saat ini agen yang dibangun oleh model besar yang terkenal, masih belum dapat mengalahkan doktor profesional pembelajaran mesin teratas. Namun, ini sangat membantu dalam pembelajaran pendukung dan memahami konten penelitian.