Точность AI-бухгалтерии: почему 95 % ничего не значат
Почти каждый AI-инструмент для бухгалтерии заявляет точность 95 % и выше, и эта цифра почти бессмысленна. В нашей собственной немецкой базе программа, которая всегда отвечает "НДС 19 %", набрала бы около 87 процентов, а на крупнейший один процент расходных строк приходится половина денег. Что стоит измерять вместо этого.
- Категория
- Общее
- Обновлено
- Автор
- Stan Kharlap
У каждого бухгалтерского продукта, который продают в 2026 году, в маркетинге есть процент точности, и почти все они лежат между 85 % и 99 %. Относитесь к этой цифре так же, как к ресторану, который сам называет себя аутентичным. Это не ложь. Это просто не измерение, потому что знаменатель вам никто не называет.
Ниже разбор на наших собственных данных, а затем вопросы, которые действительно различают продукты.
Что вообще считают эти «95 % точности»?
Точность это дробь, и у дроби должна быть база: строки, документы, поля, евро. Поставщики почти никогда не уточняют. Напрашивающееся и одновременно самое лестное допущение это на строку операции, без весов. Каждая строка считается одинаково. Кофе за три евро весит ровно столько же, сколько счёт на сорок тысяч.
Именно этот выбор и создаёт красивую цифру, потому что реальные базы перекошены сразу в двух направлениях, и оба играют на руку тому, кто считает. Norman ведёт бухгалтерию и налоги для бизнеса в Германии, и на паре сотен тысяч категоризированных расходных строк за этот год медианная строка у нас около тридцати евро.
Всегда отвечайте «НДС 19 %», и вы уже на 87 %
Начнём со ставки НДС, потому что это поле с прямыми налоговыми последствиями. В Германии базовая ставка 19 %, льготная 7 %, плюс освобождённые и необлагаемые случаи. В наших расходных строках за этот год примерно семь из восьми несут 19 %.
Значит, программа из одной строки, return 19, набирает около 87 % точности по ставке НДС. Ни модели, ни распознавания, ни обучения. Она обошла бы несколько опубликованных заявлений о точности и ошибалась бы в каждом случае, где правильная ставка вообще требует знаний.
Тот же трюк работает с категориями. У нас несколько десятков активных расходных категорий, и пять из них покрывают заметно больше половины всех строк. Классификатор, запомнивший голову этого распределения и угадывающий самую частую категорию при любом сомнении, покажет сильную цифру на строку и окажется бесполезен ровно там, где человеку нужна была помощь. Это не гипотетический сценарий, а ожидаемое поведение всего, что оптимизировали под точность на строку, потому что самая дешёвая точность всегда лежит в голове распределения.
Половина денег лежит в одном проценте строк
Теперь взвесьте по евро, а не по строкам, как это делает ваша декларация.
В наших данных на крупнейший один процент расходных строк по сумме приходится около половины всего объёма расходов. Меньшая половина всех строк вместе взятая даёт менее двух процентов денег.
Прочитайте эти два предложения рядом, и проблему станет трудно не заметить. Можно быть правым в 99 % строк и ошибаться в половине денег, или ошибаться в 20 % строк и быть финансово почти безупречным. На перекошенной базе точность на строку и точность по евро связаны слабо. Взвешенную по евро цифру не публикует никто, и только она соответствует тому, сколько вы должны.
Сложные случаи умещаются внутрь допуска на ошибку
Третья проблема самая острая. Заявление о 95 % даёт допуск на ошибку в 5 %. Спросите, насколько велика по-настоящему сложная популяция.
У нас: примерно одна расходная строка из пятидесяти это проводка reverse charge, где поставщик не выставляет НДС, а покупатель начисляет его сам. Иностранные поставщики любого рода дают меньше одной строки из десяти.
Один только reverse charge умещается в допуск 5 % дважды. Продукт может принять каждое решение по reverse charge неверно, в обе стороны, и всё равно правдиво рекламировать 95 % точности на строку. При этом именно такие проводки чаще всего дают ошибку, которую заметит налоговая, потому что они меняют, какие показатели декларации сдвигаются, а не только сумму внутри одного из них. Заголовочная метрика структурно слепа ровно к тем случаям, ради которых вас ею и успокаивают.
О чём вместо этого спросить поставщика AI-бухгалтерии
Спрашивайте про знаменатель и про хвост распределения. Ни на один из этих вопросов не трудно ответить, если ответ хороший:
| Метрика | Что измеряет | Где вводит в заблуждение |
|---|---|---|
| Точность категории, на строку | Доля строк с верной категорией | Определяется горсткой частых категорий, угадывание головы даёт высокий балл |
| Точность ставки НДС, на строку | Доля строк с верной ставкой | Константа «19 %» на немецких данных уже даёт около 87 % |
| Точность, взвешенная по евро | Доля корректно проведённых денег | Единственная цифра, совпадающая с декларацией. Почти никогда не публикуется |
| Полнота по reverse charge | Пойманные трансграничные случаи | Около 2 % строк, в любой общей цифре невидимы |
| Доля воздержаний | Как часто система не угадывает, а спрашивает | Обычно вообще не публикуется, низкое значение это предупреждение |
Последняя строка переворачивает обычный разговор с продавцом, и я взвесил бы её выше всего. Система, которая воздерживается там, где не может определить ответ, полезнее той, что на пару пунктов «точнее» и при этом молча уверена. Уверенность без воздержания это не точность, а непроверенная работа, а подписывать декларацию вам.
Ещё один вопрос: какие решения вообще уходят модели? Многое из того, что продают как суждение ИИ, это поиск по справочнику. Ставки НДС лежат в таблице, reverse charge следует из страны поставщика и характера поставки, пороги записаны в законе. Там, где правило существует, исполнить правило не просто дешевле, чем спрашивать модель, но и проверяемо, а это важно, когда налоговая спросит, почему строка проведена именно так. Где мы проводим эту границу, описано в как мы построили агента, который подаёт декларацию по НДС, а по-настоящему неоднозначный остаток идёт через цикл из чему наша категоризация учится на исправлениях.
И какая же цифра у Norman?
Справедливый вопрос, и было бы дешёвым приёмом закончить без ответа.
Из машинных категоризаций, которые наш конвейер сделал за этот год, примерно пятнадцать из шестнадцати никогда не правили руками. С другой стороны: около одной из шестнадцати исправляет тот, чьи это книги. Это наш ближайший аналог цифр из маркетинга всех остальных, и по изложенному выше аргументу впечатляться им не стоит. Это невзвешенный подсчёт на запуск, на базе ровно с тем перекосом, который я только что описал.
А вот та часть, которую я дать не могу. Наша запись об исправлении хранит, что именно изменилось и почему, но не то, к какой операции она относилась. Поэтому мы сейчас не можем взвесить собственную долю исправлений по евро. Я искал эту цифру, когда писал текст, и её нет. Это тот же самый пробел, который я критикую, только в нашей собственной телеметрии, и связать исправление с суммой теперь стоит в плане.
Но кое-что исправления всё же говорят: когда машина ставит категорию неверно, дело почти всегда в чтении документа, а не в правиле, которое его сопоставило. Лишь примерно одно исправление из шестидесяти восходит к правилу. Это эмпирический аргумент за то, чтобы детерминированную половину оставлять детерминированной.
Обязывает ли EU AI Act доказывать заявленную точность?
Нет, и это стоит понимать, прежде чем считать, что регулирование решило вопрос за вас.
Требования прозрачности AI Act по статье 50 применяются и подлежат принудительному исполнению со 2 августа 2026 года. Они требуют сообщать вам, что вы имеете дело с системой ИИ, и маркировать синтетический контент. Статья 50 ничего не говорит о точности, качестве работы и о том, как поставщику разрешено их описывать.
Обязанности, которые касаются технической документации и рисков, то есть режим высокого риска, были отложены регламентом AI Omnibus, Регламент (ЕС) 2026/1744, вступивший в силу 27 июля 2026 года. Самостоятельные системы по Приложению III получили срок до 2 декабря 2027 года, а ИИ, встроенный в регулируемые продукты, до 2 августа 2028 года.
То есть закон обязывает бухгалтерского поставщика сказать, что в продукте есть ИИ, и разрешает описывать его точность как угодно. Проверку делаете вы. Знают об этом и сами обзоры: один обзор 2026 года помечает цифры конкурентов как "[vendor claim]", прямо пишет, что такие заявления в основном не подтверждены, и приводит собственные цифры без этой пометки.
Частые вопросы
Насколько точна AI-бухгалтерия на самом деле?
На рутинных внутренних операциях современные системы действительно сильны, и заявления в диапазоне от 85 % до 99 % для этой популяции правдоподобны. Как средство сравнения продуктов они всё равно почти бессмысленны, потому что это почти всегда невзвешенные цифры на строку по сильно перекошенной базе. Спрашивайте про точность, взвешенную по евро, и отдельно про работу на нетипичных случаях, и будьте готовы, что у большинства поставщиков таких цифр нет.
Что означает точность 95 % в бухгалтерской программе?
Обычно: 95 % отдельных строк получили верную категорию, замерено на собственной выборке поставщика, без взвешивания по сумме и без отдельного отчёта по сложным случаям. Поскольку несколько частых категорий и одна частая ставка НДС покрывают большинство строк, даже тривиальный угадыватель на правилах набирает высокие восемьдесят с чем-то. Об оставшемся дорогом меньшинстве этот процент говорит очень мало.
Может ли ИИ правильно обрабатывать reverse charge?
Может, но только если продукт трактует это как правило, а не как догадку. Reverse charge следует из фактов, прежде всего страны поставщика и характера поставки, поэтому правильное решение это дерево решений по этим фактам, где модель извлекает их из документа, а не угадывает исход. Так как доля таких проводок мала, общая цифра точности ничего о них не скажет. Правила разобраны в нашем руководстве по reverse charge.
Какой ИИ лучше всего подходит для налогов?
Неверная постановка вопроса, потому что модель редко является отличием. Любая современная передовая модель прочитает чек и сложит НДС. Продукты различаются всем остальным: берут ли детерминированные правила на себя решения с детерминированными ответами, воздерживается ли система, когда нужного факта нет, оставляет ли каждая проводка проверяемый след, и подтверждает ли подачу человек.
Стоит ли спрашивать о доле ошибок на крупных суммах?
Да, и это самый содержательный вопрос списка. Поскольку стоимость так сильно сконцентрирована в крупнейших нескольких процентах строк, ошибки в этом срезе почти полностью определяют ваш финансовый риск и почти ничего не добавляют к точности на строку. Тот, кто это мерил, назовёт цифру. Тот, кто нет, повторит заголовок.
Цифра, которую я хотел бы видеть в спецификации
Если бы я мог стандартизировать для этой категории одну метрику, это была бы не точность. Это была бы доля проводок, которые система завершила без вопросов, вместе с взвешенной по евро долей ошибок на этом же множестве. Две цифры, публикуемые вместе, за названный период на реальных данных. Такую пару нельзя улучшить угадыванием головы распределения, потому что угадывание раздувает первую цифру и разрушает вторую. Первую мы можем опубликовать сегодня, вторую пока нет, и это честная мера того, насколько всё это ещё в начале.
Пока такого нет, считайте любой процент на этом рынке утверждением об уверенности поставщика, а не о ваших книгах. Спросите, что произойдёт со счётом на сорок тысяч евро и с единственной покупкой у ирландской софтверной компании. Именно там решается ваша декларация, и там нет ничего от этих 95 %.
Norman берет операционную финансовую работу на себя
От invoicing до bookkeeping: Norman организует повторяющиеся финансовые процессы так, чтобы вы успевали к дедлайнам с меньшим объемом ручной работы.