小语种准确率偏低的第一层原因是训练语料规模。英语、日语这类语种有海量平行语料,模型学得充分;泰语、越南语、印尼语的公开语料相对少,模型在长句和口语化表达上更容易出错。

第二层原因是表达习惯差异。部分语言的敬语体系、语序和省略习惯与中文差别较大,逐词对应的翻译方式容易显得别扭。

改善方法一是尽量用短句。短句给模型的上下文压力小,出错的概率明显低于长段落。

改善方法二是建术语库。把你所在行业的固定表达写进去,商业场景里最关键的往往是那几个专有名词,把它们锁死,整体可读性就会上一个台阶。