德累斯顿工大刚搞了个狠活儿——LLMpedia,直接让GPT-5、DeepSeek这些顶流大模型“闭卷考试”,不许上网搜,纯靠脑子里的参数硬写了一部百万条目的百科全书。ai4science
结果蛮好(也打脸):🔹 在维基百科已有的知识点上,GPT-5-mini真实率只有74.7%,远低于MMLU那些基准测试的90%+;🔹 到了维基没覆盖的前沿领域,真实率更是跌到63.2%;🔹 更绝的是,三个主流模型的选题重叠率仅7.3%——显然各家“脑回路”完全不一样啊项目最良心的是全开源,所有prompt、中间产物全公开,不像某些闭源百科“黑箱操作”。官方也提醒:词条可能有错,别全信~一句话总结:别被排行榜骗了,大模型的知识可靠性,远没有分数看起来那么稳。