Tři tisíce syntetických pracovních e-mailů, jednoduchý textový model a živá ukázka dostupná přímo v článku.
Některé e-maily mohou počkat do příštího týdne. Jiné vyžadují maximální pozornost, něco například blokuje expedici nebo výrobu. Zkusili jsme proto vytvořit malý model, který neřeší jen výrazy jako „urgentní“, ale hledá v textu naléhavost z kontextu, a známky toho, že na zprávu navazuje další práce.
Tři praktické úrovně
Model rozlišuje nenaléhavý e-mail bez blízkého termínu nebo blokace, naléhavý e-mail vyžadující reakci během jednoho až dvou pracovních dnů a velmi naléhavý e-mail, kde se musí jednat dnes či během několika hodin. Rozhodující je kontext, na počtu vykřičníků nezáleží.
Jak vznikla trénovací sada
Nejdříve jsme nechali vytvořit 3 000 smyšlených českých pracovních e-mailů, rovnoměrně po tisíci pro každou třídu. Zprávy mají různou délku, formálnost i oddělení, od účetnictví přes logistiku až po IT. Druhý model potom každý e-mail nezávisle označil, aniž by znal zamýšlenou třídu. Pro trénink jsme ponechali 2 581 příkladů, na zbytku se pak testoval výkon modelu.
Jen 7,4 % výsledných e-mailů obsahuje přímý výraz typu „urgentní“, „ihned“ nebo „okamžitě“. Model se proto nemůže spoléhat pouze na slovní spouštěče.
Kontrola syntetické sady
Jak to funguje?
Protože model nerozumí e-mailům stejně jako lidé, musíme text nejprve převést na čísla pomocí metody TF-IDF. Model sleduje jednotlivá slova, jejich dvojice i krátké části slov. Díky tomu dokáže zachytit české koncovky, překlepy a stručné formulace. Celkem vyhodnocuje 88 186 textových příznaků (například výskyt a důležitost slova "objednávka" v textu), ze kterých vyvážená logistická regrese vypočítá pravděpodobnost každé ze tří tříd naléhavosti.
Vložte předmět a text e-mailu. Model vrátí tři pravděpodobnosti přes naše API; zadaný text se na serveru neukládá ani neposílá třetím stranám.
Model připraven · 2 581 e-mailů · výpočet přes API
Zkusit příklad
Co ukázal odložený test
Na 517 syntetických e-mailech, které model při trénování neviděl, dosáhl přesnosti 95,9 %. Všech 200 nenaléhavých zpráv označil správně. Z 186 naléhavých zaměnil deset za velmi naléhavé a ze 131 velmi naléhavých označil jedenáct jako naléhavé. Žádný omyl nepřeskočil z nenaléhavé rovnou do velmi naléhavé třídy nebo naopak.
95,9 % není přesnost na skutečné firemní poště. Je to výsledek na syntetických datech vytvořených podle stejné definice naléhavosti a STEJNÝM GENERATIVNÍM MODELEM.
Syntetické zprávy nemohou přesně napodobit slovník, zkratky a provozní kontext konkrétní firmy. Model navíc nezná vztah mezi odesílatelem a příjemcem, historii vlákna ani interní slang. Další rozumný krok je ručně označit anonymizovaný vzorek skutečných e-mailů, změřit chyby na něm a teprve potom model případně doučit.
Model může pomoci seřadit frontu. Neměl by sám rozhodovat, který bezpečnostní incident, právní problém nebo zákazník si zaslouží pozornost.
Theine
Další krok
Poznáváte v tom svoji práci?
Přijedeme se zdarma a bez závazků podívat, kde má automatizace ve vaší firmě největší smysl.