| 首页 | 资讯 | 评测 | 活动 | 学院 | 专题 | 杂志 | 产服 |

AI大模型的语言不平等：英语最便宜，其它语言要贵得多

2023-08-01 18:37 作者：Kathy 来源：硅谷网综合关注：编辑：GuiGu 【搜索试试】

用户所使用的语言对于大型语言模型（LLM）的费用有很大的影响，可能造成英语使用者和其它语言使用者之间的人工智能鸿沟。最近的一项研究显示，由于 OpenAI 等服务所采用的服务器成本衡量和计费的方式，英语输入和输出的费用要比其他语言低得多，其中简体中文的费用大约是英语的两倍，西班牙语是英语的 1.5 倍，而缅甸的掸语则是英语的 15 倍。

注意到，推特用户 Dylan Patel（@dlan522p）分享了一张照片，展示了牛津大学进行的一项研究，该研究发现，让一个 LLM 处理一句缅甸语句子需要 198 个词元（tokens），而同样的句子用英语写只需要 17 个词元。词元代表了通过 API（如 OpenAI 的 ChatGPT 或 Anthropic 的 Claude 2）访问 LLM 所需的计算力成本，这意味着缅甸语句子使用这种服务的成本比英语句子高出 11 倍。

词元化模型（即人工智能公司将用户输入转换为计算成本的方式）意味着，除了英语之外的其他语言使用和训练模型要贵得多。这是因为像中文这样的语言有着不同、更复杂的结构（无论是从语法还是字符数量上），导致它们需要更高的词元化率。例如，根据 OpenAI 的 GPT3 分词器，“你的爱意（your affection）”的词元，在英语中只需要两个词元，但在简体中文中需要八个词元。尽管简体中文文本只有 4 个字符（你的爱意），而英文有 14 个字符。

【对“AI大模型的语言不平等：英语最便宜，其它语言要贵得多”发布评论】

版权及免责声明：
① 本网站部分投稿来源于“网友”，涉及投资、理财、消费等内容，请亲们反复甄别，切勿轻信。本网站部分由赞助商提供的内容属于【广告】性质，仅供阅读，不构成具体实施建议，请谨慎对待。据此操作，风险自担。
② 内容来源注明“硅谷网”及其相关称谓的文字、图片和音视频，版权均属本网站所有，任何媒体、网站或个人需经本网站许可方可复制或转载，并在使用时必须注明来源【硅谷网】或对应来源，违者本网站将依法追究责任。
③ 注明来源为各大报纸、杂志、网站及其他媒体的文章，文章原作者享有著作权，本网站转载其他媒体稿件是为传播更多的信息，并不代表赞同其观点和对其真实性负责，本网站不承担此类稿件侵权行为的连带责任。
④ 本网站不对非自身发布内容的真实性、合法性、准确性作担保。若硅谷网因为自身和转载内容，涉及到侵权、违法等问题，请有关单位或个人速与本网站取得联系（联系电话：01057255600），我们将第一时间核实处理。

■

相关

■

头条