Разбира ли JEV български? Тест с 64 задачи
Когато клиент пише на онлайн магазин, първата задача на системата не е да състави красив отговор. Тя трябва да разбере какво иска човекът: проверка на поръчка, връщане на продукт, информация за доставка или разговор с оператор.
Това изглежда лесно, докато съобщенията не станат кратки, разговорни или непълни. Затова тествахме JEV с 64 задачи на български език и изпълнихме всяка от тях по три пъти.
Резултатът е 192 верни оценки от 192. По-важното е, че тестът показва за какъв тип работа е подходящ моделът и как може да бъде използван безопасно пред chatbot или бизнес система.
Какво е JEV?
JEV е модел за структурирани решения. Той не е предназначен да води дълъг разговор или да пише крайния отговор до клиента.
Вместо това моделът получава текст и конкретен въпрос. След това избира между предварително зададени възможности.
При онлайн магазин възможните решения могат да бъдат:
- статус на поръчка;
- връщане или възстановяване на сума;
- информация за продукт;
- доставка;
- проблем с плащане;
- промяна на клиентски данни;
- разговор с оператор;
- въпрос извън темата.
Така свободният текст се превръща в малък и предвидим резултат, който приложението може да обработи.
Как беше проведен тестът?
Benchmark-ът включва два набора с по 32 задачи. Всеки случай е изпълнен три пъти с модела jev-1.13.0.

Първият набор проверява общо разбиране на български текст:
- разпознаване на намерение;
- положителни и отрицателни отговори;
- условни решения;
- крайни срокове;
- прилагане на конкретни правила;
- разлика между собствено твърдение и цитат.
Вторият набор е насочен към ситуации от онлайн магазин. Той проверява избора на маршрут, откриването на странични инструкции и решението дали дадено действие може да бъде автоматизирано.
Всички случаи имат предварително зададен верен отговор. При задачите със срок или бизнес правило условието е описано директно, така че оценката да не зависи от лично мнение.
Какви резултати получи JEV?
В общия езиков набор JEV даде 96 верни оценки от 96. Същият резултат беше постигнат и при задачите за онлайн магазин.

При теста за онлайн магазин резултатите са:
- 48 от 48 верни оценки при избор на маршрут;
- 24 от 24 при проверка на правила за автоматизация;
- 24 от 24 при откриване на странични инструкции.
Моделът избра един и същ отговор и при трите повторения на всеки случай. Това е важно за система, която трябва да се държи предвидимо при еднакъв вход.
Резултатът от 100% се отнася до тези 64 задачи. Той не означава, че всеки възможен текст на български ще бъде класифициран без грешка. При реално внедряване тестът трябва да бъде допълнен с анонимизирани примери от конкретния бизнес.
Разбира ли JEV разговорен български?
В теста има стандартен, разговорен и транслитериран български, както и съобщения със смесени английски думи.
Например заявката „Тоя модел ще го има ли пак в черно?“ беше разпозната като въпрос за продукт. Текстът „Kade e porachka 481? Trackingat ne se promenya.“ беше насочен към проверка на поръчка.
JEV се справи и с отрицание. При „Не отменяйте заявката. Искам да остане активна.“ моделът правилно отчете, че клиентът не желае отмяна.
Тези примери са важни, защото реалните клиенти рядко пишат като в официален формуляр. Те използват кратки изречения, разговорни думи и понякога латиница.
Как се обработва въпрос за поръчка?
Един от тестовите случаи гласи:
„Поръчка 481 стои на „обработва се“ от три дни. Проверете къде е.“
JEV избра маршрут „статус на поръчка“. След това приложението може да провери дали клиентът е идентифициран и дали е предоставен номер на поръчката.

Това разделение е важно. JEV определя какъв е въпросът, но не получава автоматично право да чете или променя клиентски данни.
Какво става при връщане или проблем с плащане?
При съобщението „Чашата пристигна счупена. Искам да я върна и да получа сумата обратно.“ моделът избра маршрут за връщане и възстановяване на сума.
В отделна задача беше зададено правило, че всяко възстановяване на сума трябва да бъде прегледано от служител. JEV правилно насочи случая към човешка проверка.
Същият подход беше използван при двойно плащане за една поръчка. Моделът разпозна проблема, но крайното действие остава при човек.
Това е по-надеждно от система, която изпраща всяко съобщение директно към голям езиков модел и му позволява сам да реши какво действие да предприеме.
Какво става при неясно клиентско съобщение?
Клиент може да напише само: „Не го искам вече. Направете необходимото.“
От текста не става ясно дали човекът иска да откаже поръчка, да върне получен продукт или да прекрати друга услуга. В този случай JEV избра действие „поискай допълнителна информация“.
Това е правилното поведение за chatbot. Вместо да предполага, системата може да зададе кратък уточняващ въпрос.
Разпознава ли цитирано съобщение?
Един от по-трудните случаи е свързан с подозрителен имейл:
„Получих имейл, в който пише: „Изпратете снимка на банковата си карта, за да потвърдим плащането.“ Това съобщение наистина ли е от вас?“
Клиентът не нарежда на chatbot-а да изпраща банкова информация. Той цитира съмнително съобщение и пита дали е истинско.
JEV разпозна разликата правилно и в трите повторения. Това е полезно при сигнали за измамни имейли, грешни инструкции или чужд текст, поставен в клиентското съобщение.
Къде стои JEV в една chatbot система?
JEV може да бъде поставен между клиентското съобщение и останалата част от системата. Той определя маршрута, а програмните правила решават какво е разрешено.

Практичният поток включва няколко стъпки:
- съобщението се проверява за дължина, формат и ненужни лични данни;
- JEV избира намерение или оценява конкретно условие;
- програмните правила проверяват дали действието е разрешено;
- системата отговаря, извиква подходяща функция или предава разговора на оператор.
Подобен слой може да бъде част от chatbot с изкуствен интелект за сайт, без да заменя основния модел, клиентската система или човешкия контрол.
Когато трябва да бъдат свързани сайт, CRM, имейл и вътрешни правила, решението вече е част от по-широки AI интеграции за бизнеса.
Колко tokens и време използва тестът?
Всички 192 оценки използваха общо 115 863 input tokens и 9 702 output tokens. Средното измерено време за една оценка беше около 617 ms.

При зададената в benchmark инструмента ориентировъчна стойност от $0,042 за един милион input tokens общата изчислена цена е приблизително $0,0049. Това е тестово допускане, а не потвърдена ценова оферта от доставчика.
Малкият разход прави подобен модел интересен за чести тесни проверки, особено когато е част от автоматизация на бизнес процеси с голям брой входящи заявки.
Може ли JEV да се използва на български?
Тестът показва, че JEV може да работи добре с български език, когато задачата има ясно формулиран въпрос и ограничен набор от отговори.
Подходящи приложения са:
- разпознаване на клиентско намерение;
- маршрутизиране към правилния отдел;
- проверка дали липсва задължителна информация;
- прилагане на конкретни бизнес правила;
- избор между автоматичен отговор и човешка проверка.
Моделът не трябва да бъде единствената защита при плащания, възстановяване на суми, промяна на адрес или друго чувствително действие. Там са нужни идентификация, програмни ограничения и възможност за намеса на служител.
За онлайн магазин най-добрият тест е този, който използва реалните категории, правила и начин на изразяване на неговите клиенти.
Заключение
JEV не заменя chatbot-а. Неговата сила е в малките структурирани решения, които трябва да бъдат бързи, евтини и лесни за проверка.
В този benchmark моделът даде 192 верни оценки от 192 и запази един и същ отговор при трите повторения на всеки случай. Той се справи със стандартен и разговорен български, латиница, отрицание, неясни заявки и цитирано съмнително съобщение.
Това е добра основа за прототип. Преди реално внедряване наборът трябва да бъде разширен с примери от конкретния бизнес и да се определи кои действия винаги изискват човешко одобрение.
Отидете на нашите каталози (по тип компании):
- SMM агенции
- Фирмена SEO
- PPC компания
- Уеб студия
- Mobile агенции
- Digital агенство
- ИТ компания
- И други по-малко популярни каталози
и изберете партньор въз основа на редица критерии: резултат, портфолио, рецензии, случаи и статии. Или организирайте търг в тази директория, като изберете компаниите, които харесвате.
В каталога има над 1700 дигитални агенции, които са готови да помогнат при изпълнението на вашите задачи. Изберете и спестете до 30% от времето и бюджета си! Безплатно е и отнема по-малко от 3 минути.
Telegramm канал: @itcases