角色扮演用哪个AI模型最好?
我们在 Nakama 支持的全部十三种语言上测试了十二个AI模型——就是你在应用里能选的那些。结论以最好的方式显得平淡:每个有实力的模型都始终保持你的语言和人设。所以真正的问题不是「哪个最聪明」,而是「同样的价钱哪个更快」。
我们测了什么,没测什么
这是可靠性测试,不是品味测试。我们没有让AI去给文笔打分——那只会测出打分者。相反,每条回复都用机械方式检查:是不是用你要求的语言回的、有没有保持人设、有没有拒绝一条无害消息、是不是根本没回。
我们给每个模型在十三种语言里各发了两段普通的角色扮演对话,都是用各语言原生撰写而非翻译。语言判定用的是公开且经过验证的检测器,不是猜的。
意外之处:可靠性基本已解决
九个模型在全部十三种语言里都100%用正确语言作答,从不拒绝无害对话,也从不为了提及自己是AI而脱人设。日语、简体和繁体中文、韩语、泰语、越南语、俄语——全都稳住了。
一年前还不是这样,较弱的模型会在场景中途飘回英文。如今,只要你选任何一个付费模型,语言漂移都不用担心。
最超值:免费与近乎免费
两个模型每条消息只要一个积分,却依然全胜。Mistral Small 4 既最便宜也属最快之列,每条回复约一秒。GLM-5.2 在可靠性上与之并列,中文最丰富,但更慢。
- Mistral Small 4 —— 1积分,约1.0秒,13种语言全部完美 —— 超值之选
- GLM-5.2 —— 1积分,中文强,较慢(约9秒)但极稳
快速中档:想要速度时
如果你想要尽可能快的回复,又不介意花一点,轻量的 Gemini 和 DeepSeek 是首选。
- Gemini 2.5 Flash Lite —— 2积分,约0.7秒,我们测到最快的干净模型
- DeepSeek V4 Flash —— 3积分,聪明且稳定
- Qwen3 235B —— 3积分,中等价位下丰富的中文
高端档:最看重深度时
对于又长又细的场景,最强的写作模型值这些积分。在我们的测试里它们并不比便宜的更可靠——记住,这测的是可靠性,不是文笔——但当你想要最好的文字时,它们才是值得花的。
- Claude Haiku 4.5 —— 5积分,同级中较快
- Gemini 3 Flash —— 5积分
- GLM-4.7 —— 5积分,推理模型:较慢,落笔前先思考
- Claude Sonnet 4.6 —— 12积分,顶级品质之选
一个坦白的局限
因为每个有实力的模型都通过了可靠性这道关,这个测试无法告诉你哪个文笔最美——那确实很主观,判断的最好办法是在同一个角色上试两三个,看你更喜欢哪种声音。在 Nakama 里换模型只需一下,而免费选项已经足够好,多数人根本不需要离开它们。
常见问题
角色扮演最好的免费模型是哪个?
在我们的测试里,Mistral Small 4(1积分)最为突出:它在13种语言里都正确作答,从不拒绝或脱人设,还以约一秒的速度属最快之列。GLM-5.2 是同样可靠的免费选项,中文最丰富,但更慢。
更贵的模型英文或中文会更好吗?
在可靠性上不会。我们测试的每个付费模型,无论便宜还是高端,都100%保持正确语言。贵的模型值在长场景的深度与文笔,而不是基本的语言正确性。
哪个模型最快?
Gemini 2.5 Flash Lite 中位约0.7秒最快,Mistral Small 4 以约一秒紧随其后。像 GLM-4.7 这样的推理模型因为要先思考再作答,所以最慢。
你们是怎么测的?
我们给每个模型在13种语言里各发两段普通角色扮演对话,用机械方式检查回复是否用对语言、是否保持人设、是否拒绝。没有让AI给文笔打分——那只会测出打分者。这是可靠性测试,于2026年7月24日进行。
聊天中途能换模型吗?
可以,在 Nakama 的任何聊天里都行,换了之后角色仍保留记忆。在同一个角色上试两三个,是找到你喜欢的声音的最好办法。