← Nakama AI

角色扮演用哪个AI模型最好?

我们在 Nakama 支持的全部十三种语言上测试了十二个AI模型——就是你在应用里能选的那些。结论以最好的方式显得平淡:每个有实力的模型都始终保持你的语言和人设。所以真正的问题不是「哪个最聪明」,而是「同样的价钱哪个更快」。

我们测了什么,没测什么

这是可靠性测试,不是品味测试。我们没有让AI去给文笔打分——那只会测出打分者。相反,每条回复都用机械方式检查:是不是用你要求的语言回的、有没有保持人设、有没有拒绝一条无害消息、是不是根本没回。

我们给每个模型在十三种语言里各发了两段普通的角色扮演对话,都是用各语言原生撰写而非翻译。语言判定用的是公开且经过验证的检测器,不是猜的。

意外之处:可靠性基本已解决

九个模型在全部十三种语言里都100%用正确语言作答,从不拒绝无害对话,也从不为了提及自己是AI而脱人设。日语、简体和繁体中文、韩语、泰语、越南语、俄语——全都稳住了。

一年前还不是这样,较弱的模型会在场景中途飘回英文。如今,只要你选任何一个付费模型,语言漂移都不用担心。

最超值:免费与近乎免费

两个模型每条消息只要一个积分,却依然全胜。Mistral Small 4 既最便宜也属最快之列,每条回复约一秒。GLM-5.2 在可靠性上与之并列,中文最丰富,但更慢。

  • Mistral Small 4 —— 1积分,约1.0秒,13种语言全部完美 —— 超值之选
  • GLM-5.2 —— 1积分,中文强,较慢(约9秒)但极稳

快速中档:想要速度时

如果你想要尽可能快的回复,又不介意花一点,轻量的 Gemini 和 DeepSeek 是首选。

  • Gemini 2.5 Flash Lite —— 2积分,约0.7秒,我们测到最快的干净模型
  • DeepSeek V4 Flash —— 3积分,聪明且稳定
  • Qwen3 235B —— 3积分,中等价位下丰富的中文

高端档:最看重深度时

对于又长又细的场景,最强的写作模型值这些积分。在我们的测试里它们并不比便宜的更可靠——记住,这测的是可靠性,不是文笔——但当你想要最好的文字时,它们才是值得花的。

  • Claude Haiku 4.5 —— 5积分,同级中较快
  • Gemini 3 Flash —— 5积分
  • GLM-4.7 —— 5积分,推理模型:较慢,落笔前先思考
  • Claude Sonnet 4.6 —— 12积分,顶级品质之选

一个坦白的局限

因为每个有实力的模型都通过了可靠性这道关,这个测试无法告诉你哪个文笔最美——那确实很主观,判断的最好办法是在同一个角色上试两三个,看你更喜欢哪种声音。在 Nakama 里换模型只需一下,而免费选项已经足够好,多数人根本不需要离开它们。

常见问题

角色扮演最好的免费模型是哪个?

在我们的测试里,Mistral Small 4(1积分)最为突出:它在13种语言里都正确作答,从不拒绝或脱人设,还以约一秒的速度属最快之列。GLM-5.2 是同样可靠的免费选项,中文最丰富,但更慢。

更贵的模型英文或中文会更好吗?

在可靠性上不会。我们测试的每个付费模型,无论便宜还是高端,都100%保持正确语言。贵的模型值在长场景的深度与文笔,而不是基本的语言正确性。

哪个模型最快?

Gemini 2.5 Flash Lite 中位约0.7秒最快,Mistral Small 4 以约一秒紧随其后。像 GLM-4.7 这样的推理模型因为要先思考再作答,所以最慢。

你们是怎么测的?

我们给每个模型在13种语言里各发两段普通角色扮演对话,用机械方式检查回复是否用对语言、是否保持人设、是否拒绝。没有让AI给文笔打分——那只会测出打分者。这是可靠性测试,于2026年7月24日进行。

聊天中途能换模型吗?

可以,在 Nakama 的任何聊天里都行,换了之后角色仍保留记忆。在同一个角色上试两三个,是找到你喜欢的声音的最好办法。

免费试用这些模型 →