各位同仁好,我是七哥。一个在高校里从事人工智能相关领域研究,钻研用大模型AI实操的学术人。可以和七哥交流学术写作或Gemini、GPT、Claude 等大模型 学术实操相关问题,多多交流,相互成就,共同进步。根据《Nature》于2025年7月10日的报道,艾伦人工智能研究所(Allen Institute for Artificial Intelligence,即Ai2)在西雅图发布了其全新科研问答基准评估平台 SciArena,对 23 个主流语言大模型的科研问答表现进行了全面评估,这次评估由 102 位研究人员通过投票来评定答案,结果显示:ChatGPT-o3 在自然科学、医疗健康、工程学以及人文社科领域的问答表现最为出色,被评为“最佳学术科研模型”,累计获得了超过 13000 票,紧随其后表现突出的还有来自中国杭州的 DeepSeek-R1,在自然科学领域排名第二、工程学第四;而谷歌的 Gemini‑2.5‑Pro 在自然科学名列第三,在工程与健康领域则分别位列第五。感兴趣的同仁可以去看原文:https://www.nature.com/articles/d41586-025-02177-7Ai2的研究科学家Arman Cohan指出,用户之所以偏爱o3模型,可能源于该模型倾向于详细阐述其引用的文献,并能生成技术细节细致入微的回应...