这是一则列表来源,站内未收录完整正文。
Hacker News 热门(buzzing.cc 中文翻译)
CrucibleBench 用 MUD 游戏评估 LLM:99 美元概念验证
AI 摘要
CrucibleBench 将大语言模型置于持久化文本世界(MUD)中,NPC 拥有记忆、信任积累机制且错误会留下痕迹,通过 50 轮交互评分。该概念验证成本仅 99 美元,旨在测试 LLM 在长期社交与任务场景中的表现。
这是一则列表来源,站内未收录完整正文。
阅读完整原文cruciblebench.ai