Использование Claude Opus 5 обходится для русскоязычных продуктов почти вчетверо дороже из-за того, что модель режет текст почти по буквам

На популярной IT-платформе Habr появилась подробная статья, посвященная скрытым затратам на обработку русского текста в современных языковых моделях.
Автор материала обратил внимание, что сравнение моделей по номинальной цене за миллион токенов вводит разработчиков в заблуждение, поскольку у каждой нейросети свой токенизатор. В ходе тестирования четырех параллельных текстов выяснилось, что отечественные решения в лице YandexGPT и GigaChat тратят на кириллицу меньше токенов, чем на английский, тогда как зарубежные модели проигрывают от 18% до почти трехкратного объема.
В частности, Claude Opus 5 расходует на русский текст в три раза больше токенов, чем на английский, делая обработку текстов на русском значительно дороже. Эксперт советует считать бюджет по реальным промптам и переносить служебные инструкции и схемы на английский язык.