← Nakama AI

角色扮演用哪個AI模型最好?

我們在 Nakama 支援的全部十三種語言上測試了十二個AI模型——就是你在應用裡能選的那些。結論以最好的方式顯得平淡:每個有實力的模型都始終保持你的語言和人設。所以真正的問題不是「哪個最聰明」,而是「同樣的價錢哪個更快」。

我們測了什麼,沒測什麼

這是可靠性測試,不是品味測試。我們沒有讓AI去給文筆打分——那只會測出打分者。相反,每條回覆都用機械方式檢查:是不是用你要求的語言回的、有沒有保持人設、有沒有拒絕一條無害訊息、是不是根本沒回。

我們給每個模型在十三種語言裡各發了兩段普通的角色扮演對話,都是用各語言原生撰寫而非翻譯。語言判定用的是公開且經過驗證的檢測器,不是猜的。

意外之處:可靠性基本已解決

九個模型在全部十三種語言裡都100%用正確語言作答,從不拒絕無害對話,也從不為了提及自己是AI而脫人設。日語、簡體和繁體中文、韓語、泰語、越南語、俄語——全都穩住了。

一年前還不是這樣,較弱的模型會在場景中途飄回英文。如今,只要你選任何一個付費模型,語言漂移都不用擔心。

最超值:免費與近乎免費

兩個模型每條訊息只要一個點數,卻依然全勝。Mistral Small 4 既最便宜也屬最快之列,每條回覆約一秒。GLM-5.2 在可靠性上與之並列,中文最豐富,但更慢。

  • Mistral Small 4 —— 1點數,約1.0秒,13種語言全部完美 —— 超值之選
  • GLM-5.2 —— 1點數,中文強,較慢(約9秒)但極穩

快速中檔:想要速度時

如果你想要盡可能快的回覆,又不介意花一點,輕量的 Gemini 和 DeepSeek 是首選。

  • Gemini 2.5 Flash Lite —— 2點數,約0.7秒,我們測到最快的乾淨模型
  • DeepSeek V4 Flash —— 3點數,聰明且穩定
  • Qwen3 235B —— 3點數,中等價位下豐富的中文

高端檔:最看重深度時

對於又長又細的場景,最強的寫作模型值這些點數。在我們的測試裡它們並不比便宜的更可靠——記住,這測的是可靠性,不是文筆——但當你想要最好的文字時,它們才是值得花的。

  • Claude Haiku 4.5 —— 5點數,同級中較快
  • Gemini 3 Flash —— 5點數
  • GLM-4.7 —— 5點數,推理模型:較慢,落筆前先思考
  • Claude Sonnet 4.6 —— 12點數,頂級品質之選

一個坦白的侷限

因為每個有實力的模型都通過了可靠性這道關,這個測試無法告訴你哪個文筆最美——那確實很主觀,判斷的最好辦法是在同一個角色上試兩三個,看你更喜歡哪種聲音。在 Nakama 裡換模型只需一下,而免費選項已經足夠好,多數人根本不需要離開它們。

常見問題

角色扮演最好的免費模型是哪個?

在我們的測試裡,Mistral Small 4(1點數)最為突出:它在13種語言裡都正確作答,從不拒絕或脫人設,還以約一秒的速度屬最快之列。GLM-5.2 是同樣可靠的免費選項,中文最豐富,但更慢。

更貴的模型英文或中文會更好嗎?

在可靠性上不會。我們測試的每個付費模型,無論便宜還是高端,都100%保持正確語言。貴的模型值在長場景的深度與文筆,而不是基本的語言正確性。

哪個模型最快?

Gemini 2.5 Flash Lite 中位約0.7秒最快,Mistral Small 4 以約一秒緊隨其後。像 GLM-4.7 這樣的推理模型因為要先思考再作答,所以最慢。

你們是怎麼測的?

我們給每個模型在13種語言裡各發兩段普通角色扮演對話,用機械方式檢查回覆是否用對語言、是否保持人設、是否拒絕。沒有讓AI給文筆打分——那只會測出打分者。這是可靠性測試,於2026年7月24日進行。

聊天中途能換模型嗎?

可以,在 Nakama 的任何聊天裡都行,換了之後角色仍保留記憶。在同一個角色上試兩三個,是找到你喜歡的聲音的最好辦法。

免費試用這些模型 →