Pembantu agentik: integrasi kalendar dan Gmail yang selamat

Oleh Win.AI Editorial

Engineer reviewing calendar, Gmail and agent audit logs on two monitors with an execution policy dashboard visible

Tuntutan saya: membina pembantu agentik yang selamat dan boleh digunakan yang bertindak pada kalendar, Gmail dan aplikasi yang berkaitan memerlukan mereka bentuk runtime yang mengutamakan kebenaran, memisahkan perancangan dari tindakan, dan membina aliran audit dan revert ke dalam lapisan pelaksanaan dari hari pertama. Artikel ini memberikan senarai semak kejuruteraan yang ketat dan arahan boleh dilaksanakan untuk mencapainya.

REKABENTUK KEBENARAN UNTUK PEMBANTU AGENTIK

Mulakan dengan OAuth per pengguna dan skop paling minimum. Gunakan OAuth terikat pengguna berbanding akaun perkhidmatan yang dikongsi kecuali jika pentadbir secara jelas memerlukan delegasi domain. Dokumentasi Google mengenai skop granular adalah asas; peta setiap keupayaan agen kepada satu skop OAuth dan dokumentasikan niat yang boleh dibaca manusia untuk skop tersebut. Simpan token di luar arahan. Simpan dalam peti simpanan dan suntik kelayakan hanya pada waktu panggilan dalam perkhidmatan pelaksanaan yang menguatkuasakan polisi.

Kami mendapati bahawa pasukan yang menganggap kebenaran sebagai UX produk, dengan skrin persetujuan yang jelas dan pratonton skop, menerima jauh lebih sedikit tiket sokongan. Satu isu yang kami hadapi ialah penyebaran token daripada logik penyegaran yang naif; pusatkan penyegaran dan putar token penyegaran secara berkala.

PERANCANGAN BERBANDING TINDAKAN

Pisahkan pembantu kepada perancang dan pelaksana. Perancang menghasilkan pelan tindakan yang terpisah: baca thread terkini, cadangkan dua waktu mesyuarat, sediakan draf email. Pelaksana hanya melaksanakan setelah pemeriksaan polisi dan, untuk tindakan sensitif, langkah pengesahan manusia. Pola ini menghalang model daripada mencipta operasi berprivilege dan menjadikan pengesahan boleh diaudit.

Perdagangan praktikal: kelewatan yang lebih lama untuk kelulusan manusia berbanding risiko yang lebih rendah. Untuk banyak tindakan kalendar dan email, jeda 30 hingga 60 saat dengan manusia dalam loop adalah boleh diterima. Untuk tugas frekuensi tinggi, kelulusan kumpulan berfungsi lebih baik daripada klik per tindakan.

UJIAN, LOG DAN PEMULIHAN

Setiap tindakan mesti menghasilkan entri audit yang tidak boleh diubah yang mengandungi niat yang diminta, output perancang, keputusan polisi, panggilan pelaksana dan respons API yang dikembalikan. Simpan format arahan yang boleh diulang supaya anda boleh mengulang dan membatalkan. Sediakan pembatalan satu klik untuk N tindakan terakhir dan aliran pemulihan yang mencipta peristiwa pampasan, sebagai contoh, membatalkan acara dan menghantar sambungan pembetulan.

Kami mendapati bahawa pagar di peringkat arahan gagal tanpa enjin polisi luaran. Dalam praktiknya, model akan mencadangkan perubahan yang kelihatan boleh dipercayai tetapi melanggar polisi. Pintu pelaksanaan yang menolak sebarang penulisan apabila keyakinan berada di bawah ambang yang dikalibrasi mengurangkan kejadian ini.

SENARAI SEMAK UNTUK PRODUK DAN KEJURUTERAAN

  1. OAuth per pengguna dengan skop minimum dan teks persetujuan yang jelas. 2. Peti simpanan token dan perkhidmatan pelaksanaan yang menyuntik kelayakan pada runtime. 3. Pemisahan perancang/pelaksana dengan pemeriksaan polisi. 4. Peningkatan manusia dalam situasi sensitif. 5. Log audit tidak boleh diubah dan format tindakan yang boleh dimainkan semula. 6. Aliran revert dan pampasan dengan kemudahan UI yang jelas.

Sambungkan UX produk kepada pola kerja yang diterangkan dalam Rekabentuk aliran kerja manusia-AI dan gunakan primer mengenai perbezaan agen dalam Agen AI vs chatbot untuk membenarkan pemisahan perancang/pelaksana.

Cuba sendiri. Arahan di bawah menunjukkan output perancang berbanding arahan selamat pelaksana. Jangkaan rancangan dari perancang yang ringkas seperti JSON dan pengesahan pendek daripada pelaksana.

Arahan ini meminta model untuk menghasilkan pelan terhad bagi waktu mesyuarat calon dan rasional; gunakan ia sebagai perancang. Jangkaan 2 hingga 3 slot calon dan rasional satu ayat.

Anda adalah perancang mesyuarat. Pengguna mempunyai 3 slot percuma hari ini: 10:00 AM, 2:30 PM, 4:00 PM. Kembalikan tepat tiga waktu mesyuarat calon dalam format ISO dengan rasional satu baris untuk setiap satu, dan nota privasi satu baris yang menyatakan sama ada jemputan menyentuh email luar.

Arahan ini adalah untuk pelaksana. Ia mengharapkan token pengesahan manusia dan lulus pemeriksaan polisi sebelum mencipta acara.

Pelaksana: jika token pengesahan pengguna X dan pelan perancang Y, panggil Calendar.CreateEvent dengan bidang {start,end,attendees,summary} hanya jika policy_check(policy_id:calendar_write) mengembalikan lulus. Jika policy_check gagal, kembalikan kod kegagalan dan tindakan manusia yang diperlukan.

Satu hujah balas ialah kawalan ketat melambatkan penerimaan. Anggaran saya adalah bahawa apabila pasukan menguatkuasakan pola ini, pengekalan pengguna awal bertambah baik kerana kepercayaan tumbuh, walaupun pengaktifan awal lebih lambat. Perdagangan itu jelas: pengeluaran yang lebih cepat tanpa kawalan ini mencipta risiko yang boleh diukur dan kos pemulihan yang lebih tinggi.

Templat viral

Terokai templat AI viral kami dan gunakannya pada foto anda.

Terokai templat