上周末参加了一场关于AI与数学科研的学术会议。说是"会议",其实规模不大,一个圆桌会议室,二十来人,但来的人构成很有意思:有做代数方向的老教授,有带过七八个博士生的中年导师,还有几个正在赶博士论文的学生,另外加两位专门做数学AI工具开发的工程师。大家坐在一起聊了一整天,话题始终绕着同一个核心:数学方向的博士生和导师,到底该怎么用AI做科研?会议没有形成什么正式决议,但有些观点反复被提出来,我认为对正在读数学博士的人、以及带数学研究生的导师来说,非常有参考价值。所以今天把这天聊的内容整理成文,再掺上我自己带学生时积累的经验,尽量给你一份"能直接用"的建议。
1. 为什么数学研究者必须正视AI
1.1 数学研究的"手工时代"正在过去
"数学不需要AI"这个观点在三五年前还能站得住脚,但现在越来越难维护了。原因有两个。第一,AI已经确实介入到了数学发现的前沿——DeepMind用强化学习找到了比人类已知更好的矩阵乘法算法,这个工作发表在Nature上,后续还被算法领域的大佬单独写文章评价;与此同时,形式化证明工具Lean、Coq这些,让我们能把一些费劲的证明边界交给计算机去验证。大语言模型的出现,更是把AI的门槛从"需要写代码调模型"拉低到"会打字就行"。
第二,数学科研的日常流程里,有大量"低创造性"的环节:读文献、找反例、写LaTeX、做数值实验、整理综述。这些环节在过去消耗了博士生大量时间和精力,而现在AI在这些环节上的表现已经足够好。也就是说,"AI能不能帮上数学研究"这个问题,答案已经不是能不能,而是怎么用、用在哪一步。
有个概率方向的博士生在会议上分享了他的经历:他花了半年时间做数值模拟,探索一个随机矩阵的谱分布猜想。后来他把这个任务的部分交给了AI,让他用Python写蒙特卡洛实验,再帮他分析结果。他说:"原来一个晚上才能完成的实验,现在用AI辅助,两个小时就能跑完,而且代码更加规范,注释齐全,连画图都直接生成好了。"这个例子很朴素,但非常有代表性——AI不会替你证明定理,但它能帮你把通往定理的路上那些土方活干完。
1.2 AI进入数学科研的三条典型路径
会议上大家讨论到AI现在能做哪些事,我总结了三条路径。
第一条路径是"计算与实验辅助"。数学研究里大量问题需要先猜一个结论,再用数值实验去验证。过去这一步要手写程序,现在大语言模型可以直接生成代码,你甚至可以把一篇PDF论文丢给它,说"帮我按照第3节的构造,写一段Sage代码验证例子"。它能做到,而且大多数时候做得不错。
第二条路径是"文献与方向判断"。新读一个领域时,最痛苦的是不知道从哪读起。用大语言模型可以快速拿到一个方向的脉络、关键论文、常用术语,相当于一个资深学长给你画了张地图。当然,这份地图必须小心使用,后面我会专门讲AI幻觉问题。
第三条路径是"推理辅助与证明形式化"。这条路径在成熟度上比前两条低,但是天花板最高。Lean 4已经有一个非常活跃的社区,很多数学家开始把自己论文里的关键定理翻译成形式化证明。更前沿的尝试是让LLM直接生成证明片段、再由Lean验证——这在逻辑上就是一个"AI生成候选+机器验证"的组合。目前它做不到自动证明任何大定理,但能在定理证明这个最困难的任务的某些局部环节帮上忙。
我自己的分类习惯是:AI在数学科研里就是一个"拥有巨大潜力但经常犯错"的研究助理,它适合干"体力活"(写代码、润色文字、整理格式),适合当"讨论伙伴"(换一个角度看问题),但不适合当"权威裁判"——它说的定理不一定对。
1.3 数学研究者抵触AI的深层原因
会议上有个话题很有意思——为什么数学圈子里很多人对AI特别反感?大家七嘴八舌聊下来,其实不完全是技术问题,也有心理层面的因素。
第一个原因是"易得性破坏了成就感"。做数学的人,成就感很大程度来自于"我花了很长时间终于证明了某个命题"。如果AI两分钟就能生成一个看似合理的证明,这个成就感就被消解了。但注意,AI"看似合理"和"真的对"之间隔着一整个严格验证的工序,所以这个心理障碍其实是误解。
第二个原因是"担心基本功坍塌"。数学的训练讲究一步步推导、亲手做完每个计算,很多导师担心学生用AI久了,连基本的换元积分、矩阵求逆都不愿意动手。这个担心反过来也成立:如果学生连基础的数学都得靠AI,那他在研究里也不会走远。所以会议的共识不是"禁用AI",而是"要让AI使用者的基本功足够强"。
第三个原因更现实——评估与激励体系还没有跟上。发论文时要声明使用了AI,什么程度要声明?课题组里的贡献怎么分配?这些问题在数学界还没有统一答案,导致一部分人选择干脆不用。另外不少数学教授使用AI的意愿较低,他们担心一个AI辅助出来的工作,无法判断里面哪些是学生自己的贡献。
要解决这些问题,只靠导师给建议是不够的,得在制度和方法论层面共同推进。这个就是后面几节要展开的内容。
2. 给数学博士生的AI使用建议
2.1 把AI用在"最没价值"的环节
博士生的时间是最宝贵的资源,也是最大的浪费来源。我见过太多学生把大量的时间花在了"胎教级"重复劳动上:整理文献格式、调LaTeX表格对齐、写数值实验代码的样板部分、把别人论文里的公式抄到笔记里。这些工作本身没有创造性,但不做又不行。
我的建议是:把这些环节全部交给AI。具体来说:
- LaTeX代码生成与修错:让LLM生成表格、公式、图表代码,修正编译错误。我自己用通用大模型来写复杂公式,节省下来的时间能有一半。
- 数值实验代码框架:做随机矩阵、偏微分方程数值解、图论模拟之前,先让AI生成初始代码框架,你再填充核心算法部分,并审查每一步是否合理。
- 文献整理与笔记摘要:用文献管理工具管理PDF库,再用AI对论文做问答和摘要切片。注意,摘要必须回溯到原始文献去核对。
为什么说"最没价值"?因为这些环节不培养任何数学直觉,你做一百遍也不会更聪明。把这些外包给AI,释放出的时间用于真正需要你的大脑的部分。
一个值得注意的技巧:不要只把问题抛给AI,而是要让AI给出"过程"而不是"结果"。比如你让它写一份蒙特卡洛模拟代码之前,先要求它解释清楚抽样方案是怎么设计的,检验统计量为什么选这个。这个对话过程能帮助你判断它到底懂不懂,也能防止你拿到的代码是"看起来能用但实际跑不通"。
2.2 用AI做自查和反例搜索的正确姿势
AI在数学科研里被用得最多的"高阶场景",可能是反例搜索。你有一个猜想,想找反例来否定它。过去你需要自己写一个搜索程序,遍历各种参数组合。现在你可以让AI先生成搜索策略,再帮你写代码,甚至让AI直接"头脑风暴"候选反例。
但这里有个大坑:AI生成的反例候选,或者AI声称"找到了一个反例",极有可能是错的。大语言模型本质是在做概率性的文本续写,它不是真的在跑数学计算。即便是强大的模型,让它举一个分式不等式反例,它都可能一本正经地编一个明显不满足条件的值。所以正确的姿势是:
- 把AI当成"思路供应商",让它给出可能出问题的边界情形,例如考虑退化情形、极端参数等。
- 让AI先写搜索代码,人工审查后再运行。
- 所有AI声称的"反例",必须用计算软件或手算严格验证。
我自己有一次让AI"找一个不满足某个图论猜想的图",它生成了一个小规模的图,并信誓旦旦地说已经验证了。我图省事,直接用了它,结果论文评审阶段被指出反例本身是错的。从那以后,凡是AI给的"事实",我必须手算或机器重算一遍。记住一条铁律:在数学科研里,AI的每一个数学断言,都必须经过你的独立验证。
如果你要做一个猜想验证的搜索,最有效的提示词结构是三步:第一步告诉AI你的研究对象和猜想本身;第二步要求它列出5个最容易出现反例的参数维度;第三步让它为每个维度写出搜索策略和代码。如果你只问"这个猜想对不对",AI往往会顺着你的话说"对"——这不是它知道对,而是因为它倾向于生成一个符合上下文的看似合理的回答。所以,问"如何验证、如何推翻"比问"是不是对"效果更好。
2.3 学术写作中的红线与自查清单
关于学术写作,很多数学博士生开始用AI润色论文、生成LaTeX、甚至帮忙梳理证明思路。这没问题,但要明确红线。
会议上我印象最深的一句话是:"AI帮你写文字可以,帮你做推导也可以,但要明确声明;更重要的是,你自己必须能解释每一个关键步骤。"数学论文不像其他学科,审稿人不会只关注"结论有没有用",在数学里,"你写的每个命题都必须能被严格证明"。AI在这方面的最大问题是幻觉——它生成一个看起来特别正常但实际上是假命题的段落时,你很难从语言风格上分辨出来。因此,凡是AI给出的新数学结论,你必须严格证明或找到出处。
我建议每个博士生建立这样的自查清单:
- 论文里每个称得上"定理"的命题,我有没有亲手证明过?
- AI生成的推导,我能否在纸上复现?
- 文中是否明确声明AI参与的部分(按期刊要求)?
- 公式和符号是否有AI生成但一查就发现矛盾的地方?
- 是否有把AI的"概率性输出"当成了"必然性结论"?
这些检查大多是自我约束,但关乎学术生涯。有一个趋势正在形成:越来越多期刊开始要求作者声明AI的使用范围。数学方向声誉很高的几本期刊已经有了明确指引——AI只能作为辅助工具,不能成为共同作者;如果用了,要在致谢或方法部分说明。所以我建议,在论文的致谢部分把"本研究使用了XX工具辅助文献检索和文字润色"写清楚,别人不会因此看不起你,反而会觉得你专业严谨。
3. 给导师的AI时代指导策略
3.1 从"知识权威"转向"方法教练"
导师这个角色,在AI时代必须转变。过去导师是"知识权威"——你懂一个领域,你知道哪些问题值得做,你能告诉学生"这个方向已经做完了""这个解法再过时"。但现在,AI已经能承担部分知识检索和基础推导的任务,学生通过AI可以快速了解一个领域的大致轮廓。这时候,如果导师还停留在"告诉你什么是正确答案"的层面,价值会被大幅稀释。
会议上有位导师说得很到位:"我以前做的事,30%是告诉学生某个定理在某本参考书的某一页,现在AI能更快地告诉他。我真正剩下的价值,是告诉他这个定理为什么有趣、为什么值得证明、以及证明中哪个地方藏着一个陷阱。"这就是从"知识权威"转向"方法教练"的过程。导师应该更关注教学生"如何提问题""如何设计验证""如何判断一个方向是否有价值"。
另外要注意的是,当学生用AI做研究时,导师需要增加一个额外的任务:检查学生的AI使用方式是否健康。主动问学生"哪里用AI了?怎么验证的?",等于用这些问题强化学生的批判性思维。如果学生的回答是"我让AI证明了,它说没问题",这时候就该警惕了——这不是AI的问题,这是使用方法的问题。
3.2 课题组AI使用规范的四个核心条目
会议上几位导师一致认同:课题组最好有一个明确的AI使用规范,而不是等出了问题再事后追溯。我整理了一下,规范的四个核心条目大概是:
- 明确AI的允许使用范围。例如:允许用于文献检索、代码生成、文本润色、数值实验;不允许直接生成定理证明并在不经人工验证的情况下进入论文。
- 明确披露机制。无论哪个环节用了AI,学生需要在组会汇报中说明用了什么工具、在哪一步、如何验证。
- 建立人工验证责任。每一个AI参与的关键结论,必须有一个由学生或合作者"亲手完成"的验证记录。
- 保护学术独立。开题、资格考试、课程作业等基础训练阶段,限制AI直接给出答案。
这些条目不是要管死学生,而是给他们一个边界。有边界的使用,比没有边界的全面依赖要健康得多。
3.3 重新定义"基本功"与成果评估
我当了这些年导师,越来越意识到一个问题:博士生毕业后带走的不是几篇论文,而是一套"独立做研究的能力"。在AI时代,这个能力的内涵变了。过去的基本功是"会手算、会背诵经典证明、会写论文",现在是四件事:能设计可行的研究框架、能批判性地使用AI工具、能严格验证一切论断、能独立判断研究的价值。
导师评估学生成果时,如果只看论文数量和质量,很容易被AI水位混淆。更好的做法是看过程:学生的研究日志、中间失败的尝试、对AI输出的修改程度,以及学生能否在口头答辩中解释清楚每一个关键步骤。我们可以把AI产出理解为"原材料",而学生真正的成果是"加工、验证、判断之后的东西"。判断一个学生有没有成长,不是看他有没有交出AI生成的漂亮结论,而是看他有没有能力说清楚"为什么这个结论是对的,在哪里可能出错"。
会议最后有一个很扎心的观点:在AI时代,博士生和导师是"同一条船上的学习者"。导师不再拥有"我比你懂更多"的天然优势,但依然拥有"我更懂科研的本质"的经验积累。谁先学会把AI当成科研基础设施,谁就能在下一个十年里做出更有影响力的工作。
4. 一套可复制的数学科研AI工作流
这一章偏实操一点。我不会去推销某个具体的付费产品,而是给你一个组合思路。
4.1 工具选型:不同任务该用哪类工具
我建议的配置是"通用大语言模型+形式化证明工具+专用计算软件"。具体到选择哪一款LLM,现在国内外有好多选择,各有各的强项,关键在于你要学会针对不同任务选择合适的模型。比如想快速完成代码生成和格式整理,多数通用模型都能胜任;想做严谨推理的初稿,尽量选择在数学推理基准上表现较好的模型。我自己习惯用几个模型并行工作:一个负责文字和代码,一个负责数学推导建议,一个专门用来做逆向检查、专门挑错。这个"交叉验证"的工作方式,比单吊一个模型要可靠很多。
专业计算软件方面,Mathematica、Maple、SageMath都是数学科研常用的。这里必须强调一点:大语言模型生成的是"文本",而SageMath执行的是"计算"。任何需要精确计算验证的结论,请以专业软件的输出为准,而不是以LLM的承诺为准。形式化证明方面,Lean 4近年势头很猛,数学界参与度很高,值得投入时间去学;Coq和Isabelle在理论计算机方向更常见,按你的领域选择即可。
4.2 从文献到猜想再到验证的四步工作流
我建议博士生尝试下面这个四步工作流。
第一步:领域入图。把你自己选题方向的核心文献、主要矛盾给LLM,让它生成一个"研究地图"初稿。所谓研究地图,就是列出这个领域的几个主要分支、每个分支的代表人物、代表性工作、未解决问题。你用半小时和AI对话,能获得过去需要读一周文献才能大致形成的框架感。但注意,地图必须用真实文献逐条核实,特别是作者和年份这些细节,AI经常张冠李戴。
第二步:问题定位。在地图基础上,你圈定1到2个感兴趣的问题,让AI从不同角度帮你列出"可能的突破口"。这些突破口不是答案,而是候选方向。标准是:能被AI给出具体检验方法的才值得往下走。这里有一招很实用:让AI为每个候选突破口设计一个"最小验证实验"——一个能花半天时间做完的小计算或小例子,用来判断这个方向是否靠谱。
第三步:计算验证。用LLM生成的代码在数学软件中跑最小验证,检查规律是否成立、有没有反例。这一步我至少要跑三组不同的参数,以确保不是过拟合。如果通过了,再扩大到更大规模的数值实验。
第四步:证明与写作。在结论初步成型后,你开始尝试严格证明。AI可以帮你生成证明草稿、梳理逻辑链、找出反例破碎点,但最终证明必须由你的名字背书。写作阶段用LaTeX搭配AI排版和润色完成。
这四步其实可以对应不同的"AI角色":地图师(信息整理)、顾问(问题定位)、实验员(代码执行)、校对员(写作润色)。用得好,博士生的科研效率可以提高很多,而且更重要的是——它把人的时间集中到高阶创造性活动上。
4.3 一个具体实操示例
我拿我自己最近一次带学生做的事情举例子:探索一个关于双曲几何中测地线长度的数值规律问题。
流程是这样的。我的博士生先让AI生成一份关于"双曲几何中测地线数值研究"的文献清单初稿——AI列了15篇,我们核实后,大概有6篇是靠谱的,其余要么年代错乱、要么主题不对。这一步骤大约花了我们两个小时,如果不用AI,光检索和筛选文献就要花半个月。
接着,我们用AI辅助搭建了一个数值实验框架:给定一个双曲圆的平移矩阵,让AI生成Python代码,计算该矩阵作用下的测地线的长度分布。AI给的代码第一版能跑,但是数值精度不够,我们让它修改算法,改用了双精度浮点数下的稳定算法。这个代码调试过程,过去可能要花三到四天,现在用了一个下午。
拿到初步数值数据后,我们观察到某种线性关系,让学生尝试用经典方法去证明。这时候AI做了一件很好的事:它建议我们把问题通过一个保角变换转化为上半平面模型,这个视角转换帮助打开了证明思路。AI在这里的角色不是"提交证明",而是"提供关键启发"——最终还是学生自己捣鼓出了证明。在这个整个过程中,AI参与了所有环节,但核心创造力和验证责任始终在学生手里。我觉得这就是数学科研使用AI的理想形态。
5. 常见问题与避坑实录
5.1 AI幻觉:最危险的敌人
大语言模型的"幻觉"问题是数学科研里最危险的。它不像代码报错那么明显,经常是"看起来完全正常但内容是编造的"。尤其是数学这种以严谨为生命的学科,AI幻觉可以直接毁掉一个研究项目甚至一篇论文。
防止幻觉的办法:
- 对AI输出进行"出处检查":凡涉及定理、引理、参考文献,要求AI明确指出出处,然后你去核实。
- "反向提问":让AI自己指出回答中的疑点,例如"请检查以上推导的第三步,是否会因为分母为零而失效?"
- 使用验证工具:所有数学计算必须以计算软件的结果为准。
我在实践中总结的技巧是:用一个专门的LLM扮演"怀疑者",对另一个模型的结论进行挑刺。这个"红队-蓝队"的打法,在数学验证上意外地有效。你可以这样组织:让模型A尝试证明一个命题,让模型B试图找出A证明中的漏洞。很多时候,模型B能发现A忽略的边界条件。两个AI互相较劲,比自己吭哧吭哧检查轻松不少,但最后的裁决还得人来定。
5.2 学生过度依赖AI:导师该怎么办
这可能是导师们最担心的问题。学生在AI辅助下看似高效,实际上可能正在"失去肌肉力量"。我的经验是:设置"无AI日"或者"无AI任务"。例如在组会上的黑板推导环节,明确规定不许用AI;每周至少花一个下午做"纯手工"的推导和计算。这就像健身一样,你不能因为有了电梯就不练爬楼,肌肉会萎缩。
另外一个方法是:随时抽查。让学生在没有AI的情况下临时推导一段课堂上讲过的定理,如果推导不出来,就说明他依赖AI过深。这不是惩罚,而是提醒——你还需要在关键技能上多花时间。会议上有位导师说了一句让我印象深刻的话:"AI是翅膀,不是拐杖。翅膀能让你飞得更高,拐杖只会让你的腿越来越不管用。"这句话我后来反复在组会上引用。总之,导师不需要禁止学生用AI,但需要定期检验学生的独立能力。
5.3 学术诚信灰色地带:如何自查
学术诚信问题在AI时代变得非常微妙。过去"抄袭"是很清楚的,现在呢?AI帮你写的段落算不算抄袭?AI生成的推导如果你不验证就放进论文,算不算学术不端?这些问题没有统一答案,但会议上的共识是:透明最好。任何有疑虑的地方,都主动声明、主动展示验证过程。编辑和审稿人不会因为你用了AI而退稿,但一旦被发现隐藏AI参与并误导评审,那才是真正的学术事故。
从实际操作层面,我建议你在实验室里养成记"AI使用日志"的习惯。不用很复杂,一个文档里记下每天在哪些环节用了哪些工具、做了哪些验证。这不仅是保护你自己,也能帮助导师了解你的产出过程。将来要发表的时候,这个日志会让你有据可查。
5.4 值得长期坚持的四个习惯
最后分享几个我坚持了很长时间的习惯。
- 每天用AI十五分钟做"挑战式阅读":拿一篇你正在读的论文的摘要,问AI"这个结论的成立条件是什么?如果不是这个条件会怎样?",训练自己跳出论文的原始框架。
- 对不理解的AI输出,要求它"用小学生能听懂的话解释一遍"——这个要求会逼AI,也逼你自己把逻辑链条想清楚。
- 用AI生成"反例狩猎清单":在研究一个命题时,定期让AI列出可能让命题失败的构造。不需要相信它,但它会提醒你去检查那些容易被忽略的极端情况。
- 定期"闭关":每个月挑一两天完全不用AI,只靠纸笔做推导。这既是对基本功的保养,也是对AI依赖的刹车。
我个人这些年的体会是:AI在数学科研里最正确的定位,不是"替代思考",而是"放大思考"。它把博士生从低价值的重复劳动里解放出来,把导师从知识权威的位置上拉下来,逼着整个数学界重新思考"什么是研究能力"这个问题。会议结束的时候,有一位老教授说了一句话,我深以为然:"未来十年的数学博士,拼的不再是谁更会算,而是谁会提出更值得研究的问题,以及谁能更高效地验证自己的想法。"AI是一个放大器,你本身的科研能力越强,它放大的效果就越明显;如果你本身基本功不扎实,它也会很快把你的短板暴露出来。
希望这份会议摘要式的整理,能给你一些真正用得上的参考。无论你是博士生还是导师,都可以先从一个小环节入手试试——比如下周用AI帮你处理一次文献整理,或者帮你调试一段数值模拟代码。先用起来,再用对,最后形成自己的方法论。别急着全面拥抱,也别一口咬定没用,一步一步来,数学科研的AI时代,已经开始了。