拼图、谜题与游戏一直是检验人工智能能力的试金石。从最早的西洋跳棋、国际象棋,到围棋,开发者用一道道”…
一款身份未公开的免费 AI 编程模型,在业内最难啃的软件工程评测之一上,跑出了超越同脚手架类别所有商业模型的成…
十大聊天机器人测评:假话率一年翻倍,Claude 最稳 Pi 最离谱 新闻事实核查机构 NewsGuard 最…
同一句话喂 11 个 AI,结果差出 200 倍 同一个问题,交给不同的大模型,得到的答案可能天差地别。Net…
智力指数 61:与 GPT-5.6 持平 评测机构 Artificial Analysis 于 2026 年 …
过去一年,开发者社区里流传着一个听上去很合理的判断:让大模型写代码时,动态类型语言比静态类型语言更划算,因为省…
抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布…