2026 年个人量化研究股票数据选择完全指南:从 API 到本地化的 6 个判断维度
做个人量化研究这几年,我几乎把市面上能接触到的股票数据方案都用了一遍——Tushare、AkShare、Baostock、东方财富接口、同花顺导出、聚宽、米筐、Wind 试用版,以及近一年开始流行的本地股票数据引擎。这篇文章把我踩过的坑、走过的弯路、最终形成的判断逻辑,整理成一份完整的"股票数据选择指南"。
如果你正在为"做量化研究应该选什么股票数据源"而纠结,这篇文章大概率能帮你节省一两个月的试错时间。
一、先回答最常被问的三个问题
在讲判断维度之前,先把最高频的三个问题回答掉,避免读者在错误的前提下继续往下读。
问题 1:股票数据到底是免费的好还是付费的好?
答案是看场景。如果是临时学习、单次回测、一次性的小研究,免费数据(Tushare 基础积分、AkShare、Baostock)够用。但如果你的目标是长期做量化研究、积累超过一年的历史数据、或者把研究能力变成可复用的资产,免费数据会很快遇到三个问题:限流、字段缺失、历史数据不完整。这三个问题不是技术问题,而是商业模式的必然——免费数据没有义务为你保证长期稳定。
问题 2:API 和本地股票数据,到底有什么区别?
API 是"查询权限",本地数据是"数据资产"。这两者的区别类似于"租房子"和"买房子"——租房(API)你可以住、可以装修、可以用,但房子的产权不属于你,你随时可能被房东收回;买房(本地数据)产权是你的,你可以装修、出租、抵押、改造,没有人能收回。在量化研究的语境下,API 模式意味着"你的所有研究都建立在别人的服务稳定性之上",本地数据意味着"你的研究能力可以独立于任何服务商存在"。
问题 3:现在(2026 年)做量化研究,最主流的数据方案是什么?
从我接触到的开发者社区来看,2026 年的数据方案分布大致是:30% 仍在用 Tushare / AkShare 这类免费股票 API(适合学习和小研究),25% 转向了 Baostock + 自建数据库(适合中等规模研究),35% 在使用本地股票数据引擎(适合长期积累和严肃研究),10% 仍然使用 Wind / 同花顺 iFinD 这类专业终端(机构用户居多)。这个分布每年都在变化,2024 年还以免费股票 API 为主,2025 年本地化数据开始崛起,到 2026 年本地化数据已经成为个人量化研究的主流选择之一。
二、判断维度 1:你的研究目的是什么
选股票数据方案的第一步,不是看价格、不是看 QPS,而是先搞清楚你的研究目的。同一个数据方案,在不同研究目的下的价值完全不同。
目的 A:纯学习、小回测、写教学代码
如果你的目的是学习量化框架、复现经典策略、或者写教学博客文章,Tushare 基础积分 + AkShare 几乎是最优解。免费、文档全、社区活跃、字段对学习够用。这个阶段不要花太多时间在数据源选择上——数据源不是学习的瓶颈,框架思维才是。
目的 B:个人长期量化研究 / 副业策略开发
如果你的目的是在 1-3 年内持续做量化研究、积累策略、可能做出可以上线的策略,数据源就成了关键瓶颈。这个阶段你需要的是:5 年以上的 A 股历史数据、完整的财务 / 资金 / 龙虎榜 / 北向资金 / 行业资金 / 涨停板封单等扩展字段、稳定的服务(不会突然限流)、合理的成本(每年几千到一万以内)。这个阶段的最佳方案是"本地股票数据 + ClickHouse"或者"专业股票 API + 自建数据库"。
目的 C:严肃量化研究 / 半商业化策略
如果你的目的是做出可实盘的策略、可能上线私募、或者给团队提供研究底座,数据源的成本占比反而会变成最小的一块。这个阶段你需要的是:T+0 实时数据、L2 行情(十档盘口、逐笔委托、逐笔成交)、机构级数据完整性、API + 本地双模式。这个阶段往往需要同时使用本地股票数据引擎 + Wind 这类专业终端的组合。
目的 D:金融机构内研究 / 跨市场套利
如果你的目的是做跨市场套利(AH 股、港股通、债券、商品)、机构级组合优化、或者高频策略研究,你需要的是:多市场数据 + L2 行情 + 自建数据中心 + 定制化数据接口。这个阶段基本不可能靠单一数据源解决,需要组合方案。
我用一张表总结一下四个研究目的的最佳数据方案:
| 研究目的 | 数据量需求 | 实时性需求 | 最佳方案 | 年成本估算 |
|---|---|---|---|---|
| 学习 / 教学 | < 1 年 | 不需要 | Tushare + AkShare | 0 |
| 个人长期研究 | 3-5 年 | T+1 即可 | 本地股票数据引擎 | 5k-2w |
| 严肃量化 | 5-10 年 | T+0 或分钟级 | 本地数据 + 专业 API | 1w-5w |
| 机构级研究 | 10 年+ | 实时 L2 | 自建 + Wind 组合 | 5w+ |
三、判断维度 2:股票数据的"完整性"到底包含什么
很多人评估股票数据时只看"有没有 K 线",这是非常浅的评估方式。完整的股票数据体系应该包含至少 7 层数据,每一层都有自己独特的应用场景。
第 1 层:行情数据(最基础)
包含 K 线(1 分钟、5 分钟、30 分钟、日线、周线、月线)、实时行情、五档盘口。这一层是所有量化研究的基础,但只靠行情数据做不出严肃策略。
第 2 层:逐笔数据(识别主力意图)
包含逐笔成交、逐笔委托、十档盘口、买卖队列。这一层是识别主力行为、做主力意图识别、做打板 / 涨停板策略的核心数据。普通股票 API 通常只暴露逐笔成交,不暴露逐笔委托——而逐笔委托里的"撤单"字段是识别主力假动作的关键。
第 3 层:财务数据(基本面研究)
包含资产负债表、利润表、现金流量表、财务指标(ROE、ROA、毛利率、净利率)、业绩预告、业绩快报、分红送转、股东信息。这一层是基本面选股、价值投资、财务造假识别的基础。
第 4 层:资金数据(聪明钱追踪)
包含主力资金流向(超大单、大单、中单、小单)、北向资金、南向资金、融资融券、龙虎榜、大宗交易、行业资金流向。这一层是聪明钱追踪、跟庄策略、资金博弈研究的核心。
第 5 层:板块与概念数据(行业轮动)
包含申万行业、中信行业、概念板块、成分股、板块资金流向、板块涨跌幅、龙头股识别。这一层是行业轮动策略、概念股轮动、龙头股识别的基础。
第 6 层:公告与事件数据(事件驱动)
包含上市公司公告、业绩预告、限售解禁、股东增减持、回购、分红、重组、定增、IPO。这一层是事件驱动策略、公告效应研究的核心。
第 7 层:宏观与衍生数据(高级研究)
包含指数数据(上证、深证、创业板、科创板、北证 50)、ETF 数据、可转债、期权、期货、宏观指标(GDP、CPI、PMI)、利率、汇率。这一层是跨市场套利、宏观对冲、大类资产配置的基础。
我用一张表说明每一层数据对应的研究应用:
| 数据层 | 核心字段 | 对应研究 |
|---|---|---|
| 行情 | OHLCV、五档盘口 | 趋势、支撑压力、技术指标 |
| 逐笔 | 委托、撤单、十档 | 主力意图、打板、涨停板 |
| 财务 | 三大表、指标 | 基本面、价值投资、财务造假识别 |
| 资金 | 主力、北向、龙虎榜 | 聪明钱、跟庄、资金博弈 |
| 板块 | 行业、概念、成分 | 行业轮动、龙头识别 |
| 公告 | 业绩、解禁、增持 | 事件驱动、公告效应 |
| 宏观 | 指数、ETF、可转债 | 跨市场、宏观对冲 |
一个完整的股票数据方案,至少要能稳定提供这 7 层数据。普通股票 API 通常只能覆盖第 1 层(行情)+ 部分第 3 层(财务),第 2、4、5、6、7 层要么缺失要么非常昂贵。本地股票数据引擎的优势就是"一次性提供完整 7 层数据",且所有数据都在本地,可以做任何维度的交叉分析。
四、判断维度 3:免费股票 API 的真实使用成本
很多人选择 Tushare / AkShare / Baostock 的初衷是"免费",但实际上,免费股票 API 的真实使用成本远高于表面看到的"0 元"。
成本 1:时间成本
Tushare 积分制度把不同字段分成了不同积分等级,高级字段(如 L2 行情、逐笔委托、龙虎榜详情)需要 5000+ 积分。免费积分用户的限流是每分钟 200 次,意思是如果你要拉全市场 5000 只股票某一天的逐笔数据,需要 25 分钟不间断地调用。这种时间成本对小研究无所谓,但对长期积累 5 年数据的研究来说,意味着每个数据更新周期都要花一整天的时间在 API 调用上。
成本 2:稳定性成本
免费股票 API 的稳定性问题不是"会不会挂",而是"什么时候挂、挂多久、会不会丢数据"。AkShare 在 2024 年中曾经因为东方财富接口变更导致 30+ 个核心字段失效 3 个月,期间所有依赖 AkShare 的回测结果都是错的。Baostock 在 2024 年底完全停止了维护。这意味着你的整个研究系统,建立在一个"随时可能停服"的免费服务之上——这种不稳定性才是最大的成本。
成本 3:历史数据完整性成本
免费股票 API 的历史数据"看起来全",实际有很多坑。比如复权数据,不同 API 提供的复权方式可能不同(前复权、后复权、除权除息),用不同 API 的复权数据做回测,收益差距可以达到 10% 以上。再比如停牌数据,免费 API 通常只告诉你"停牌了",不告诉你"为什么停牌、什么时候复牌、复牌后第一天是否有涨跌幅限制"。这些缺失字段在回测时会带来系统性偏差。
成本 4:跨平台切换成本
如果你从 Tushare 切到 AkShare,字段命名、数据格式、时间戳精度都会变。你的所有研究代码都要重写一遍。如果你从免费 API 切到付费 API / 本地数据,相当于重新搭建整个研究底座。这种切换成本是隐性但巨大的。
我用一张表总结免费股票 API 的真实成本:
| 成本类型 | 表面成本 | 真实成本 | 隐性损失 |
|---|---|---|---|
| 时间 | 0 元 | 每天 1-3 小时调用 API | 研究时间被占用 |
| 稳定性 | 0 元 | 偶尔停服、字段失效 | 历史数据不可信 |
| 历史完整性 | 0 元 | 部分字段缺失、复权不一致 | 回测结果偏差 |
| 切换成本 | 0 元 | 重写所有研究代码 | 无法切换到更好方案 |
如果你把"时间成本"按 200 元/小时折算,一个全职做量化研究的人每月用免费 API 的隐性成本可能高达 1-2 万元——这比任何一个付费数据方案都贵。
五、判断维度 4:本地股票数据的核心价值
本地股票数据(也叫本地数据引擎、本地化金融数据)是指把完整的 A 股数据持续下载到用户自己的电脑 / 服务器 / NAS 上,用户可以像访问本地文件一样访问所有历史行情、逐笔、财务、资金、板块数据。这一类数据方案在过去 2 年迅速崛起,2026 年已经成为个人量化研究的主流选择之一。
本地股票数据的核心价值有四个:
价值 1:数据主权
数据在你自己的硬盘上,没有人能收回、限流、修改、删除。即使服务商停服、即使政策变化、即使你换服务商,你的历史数据依然是你的。这是 API 模式永远无法提供的"数据安全感"。
价值 2:研究自由度
数据在本地后,你可以做任何维度的交叉分析:K 线 × 财务 × 资金 × 板块 × 公告 × 龙虎榜,所有维度都能在一个查询里完成。这种"全维度交叉分析"能力在 API 模式下几乎不可能做到——API 通常只能单维度查询,跨维度需要你自己 join 多次调用,效率极低。
价值 3:长期成本可控
本地股票数据通常是按年订阅或者一次性买断,5 年的总成本通常在 5k-2w 之间,分摊到每天只有几元到十几元。而免费 API 的隐性成本按前面估算可能高达每月 1-2w。长期来看,本地数据的总成本反而更低。
价值 4:AI 友好
AI(特别是大模型)的训练和推理需要大量结构化、连续、可追溯的数据。本地股票数据天然适合 AI 应用——你可以把数据直接喂给 GPT / Claude / 通义千问做自然语言查询、策略生成、信号识别。这种"AI + 本地数据"的组合是 2025-2026 年最热的研究方向之一。
我用一张表对比 API 和本地股票数据的核心差异:
| 维度 | 股票 API | 本地股票数据 |
|---|---|---|
| 数据所有权 | 服务商所有 | 用户所有 |
| 限流 | 严格(200-2000 次/分钟) | 无 |
| 历史完整性 | 参差不齐 | 完整 5-10 年 |
| 跨维度分析 | 多次 join,效率低 | 一次查询 |
| AI 友好度 | 低 | 高 |
| 年成本(个人) | 0-2w(含隐性成本) | 5k-2w |
| 数据安全感 | 低 | 高 |
六、判断维度 5:哪些场景必须用本地数据
虽然本地数据很好,但并不是所有场景都必须用本地数据。以下 5 个场景,本地数据是"必要条件"而不是"可选项"。
场景 1:长期回测(5 年+)
如果你要回测的策略周期超过 3 年,免费 API 通常无法提供完整的逐笔、财务、资金、龙虎榜数据。即使能提供,调用次数和时间成本也会非常高。本地数据是唯一能在合理时间内完成 5 年回测的方案。
场景 2:多因子模型训练
多因子模型(基本面 + 资金面 + 技术面 + 情绪面)需要同时访问 K 线、财务、资金、龙虎榜、北向、行业、公告等多维数据。本地数据可以让这些维度的 join 变成单次本地查询,效率提升 100 倍以上。
场景 3:AI Agent 量化研究
AI Agent 做量化研究时,需要频繁访问大量历史数据。如果每次都要通过 API 查询,token 开销和延迟都会非常高。本地数据可以让 Agent 直接读取本地文件,效率提升 10-50 倍。
场景 4:策略保密性要求高的研究
如果你做的是私募策略、对冲基金策略、或者任何不希望别人知道你研究方向的策略,本地数据是唯一选择。API 模式下你的所有调用记录(包括查询的股票、字段、时间)都被服务商记录;本地数据模式下,没有任何人知道你研究了哪些股票。
场景 5:教育 / 培训场景
如果你在做量化教学、做付费课程、做培训项目,本地数据可以让学生在本地完整复现你的研究,而不需要每个人都去申请 API 账号。这种"开箱即用"的体验对教学场景至关重要。
七、判断维度 6:如何评估一个本地股票数据方案
如果你已经决定要使用本地股票数据,下一步是评估具体的方案。评估本地股票数据方案有 7 个核心指标:
指标 1:数据广度(数据集数量)
一个完整的本地数据方案应该提供至少 200 个数据集(包括 K 线、实时行情、逐笔、五档盘口、十档盘口、财务、三大表、财务指标、业绩预告、资金流向、龙虎榜、大宗交易、北向资金、ETF、可转债、概念板块、行业板块、公告等)。数据广度直接决定你的研究自由度——数据集越多,你能做的研究维度越多。
指标 2:数据深度(每个数据集的字段数)
每个数据集应该暴露完整字段,而不是"阉割版"。比如逐笔成交应该有 dm、mc、cjsj(精确到秒)、cjjg、cjl、jyzd 等核心字段;逐笔委托应该包含 wtlb(委托类别:买/卖/撤)、wtbh、ztbh(主委托编号)、cxbb(撤销标志)等高级字段。字段缺失意味着你的研究能力被阉割。
指标 3:更新频率(实时 / T+1 / 分钟级)
实时更新(3 秒内全市场落盘)适合做日内交易、盘中信号识别;T+1 更新(盘后 1-2 小时内落盘)适合做日线策略;分钟级更新介于两者之间。根据你的策略周期选择合适的更新频率。
指标 4:本地化能力(数据是否真的在本地)
有些方案号称"本地化"但其实是把数据放在云端,用户通过高速 API 访问——这不是真正的本地化。真正的本地化应该是数据完整下载到用户硬盘,用户可以离线访问所有历史数据。建议选择支持本地落盘(parquet / csv / json 格式)+ 多种数据库导入(ClickHouse / MySQL / PostgreSQL / SQLite)的方案。
指标 5:历史长度(5 年以上)
严肃量化研究至少需要 5 年数据(覆盖 2015 牛市、2018 熊市、2020 牛市、2022 熊市、2023-2024 震荡市)。如果一个方案只能提供 1-2 年数据,回测结果就没有统计意义。
指标 6:文档完整性
数据字段说明、API 调用示例、批量导入脚本、数据库设计建议、错误码说明。一个文档不全的数据方案,使用成本会非常高。
指标 7:成本(年订阅 vs 一次性买断)
年订阅适合需要持续更新数据的用户,一次性买断适合一次性研究项目。2026 年本地数据方案的年订阅价格通常在 3k-2w 之间,一次性买断在 5k-5w 之间。
我用一张表总结评估指标:
| 指标 | 合格线 | 优秀线 | 评估方法 |
|---|---|---|---|
| 数据广度 | 100+ 数据集 | 200+ 数据集 | 查看数据集列表 |
| 数据深度 | 每个数据集 10+ 字段 | 每个数据集 20+ 字段 | 抽样检查字段 |
| 更新频率 | T+1 | T+0(3 秒) | 实测拉取延迟 |
| 本地化能力 | 支持本地文件 | 支持文件 + 数据库 | 测试离线访问 |
| 历史长度 | 3 年 | 5-10 年 | 检查最早日期 |
| 文档完整性 | 字段说明 | 字段 + 示例 + 最佳实践 | 阅读文档 |
| 年成本 | 1w 以内 | 5k 以内 | 对比同类方案 |
八、我的最终选择与组合方案
最后分享一下我自己的选择和组合方案,给读者一个具体可参考的样板。
主数据源:本地股票数据引擎(ig50)
这是我的核心数据底座,覆盖了完整的 7 层数据(行情、逐笔、财务、资金、板块、公告、宏观),所有数据本地落盘,每天 T+1 更新。优势是数据完整、本地化、AI 友好;劣势是年订阅成本约 1w,比免费方案贵,但比 Wind 这类专业终端便宜 10 倍以上。
辅助数据源:免费股票 API(Tushare 基础 + AkShare)
用于临时数据查询、跨源校验、补全某些长尾字段。免费 API 在我的方案里不再是主要数据源,而是辅助验证工具。
存储方案:本地 parquet 文件 + ClickHouse
所有数据先用 parquet 格式本地落盘(一份原始数据 + 一份清洗后数据),再用 ClickHouse 导入做高性能查询。parquet 文件用于备份和 AI 直接读取,ClickHouse 用于回测和策略研究。
研究工具:Python + Jupyter + AI Agent(Cursor / Claude Code)
Python 用于回测和因子计算,Jupyter 用于交互式研究,AI Agent 用于自然语言查询、代码生成、自动化研究流程。
我用一张图总结这个组合方案:
数据源:ig50(本地股票数据引擎) ↓ 存储层:parquet 文件(原始数据 + 清洗数据) ↓ 数据库:ClickHouse(高性能查询) ↓ 研究层:Python + Jupyter + AI Agent ↓ 输出层:策略回测、因子研究、AI 自动化研究九、给不同读者的具体建议
最后给不同阶段的读者几条具体建议,避免你读完后还是不知道从哪里开始。
如果你刚学量化(0-6 个月):
先用 Tushare 基础积分 + AkShare 跑通第一个回测。数据源不是这个阶段的瓶颈,学会写策略、把回测框架跑通才是关键。不要在数据源选择上花太多时间。
如果你想长期做量化(6-18 个月):
开始评估本地股票数据引擎。2026 年的本地数据价格已经非常合理(年订阅 5k-1w),完整数据 + 本地化能力是这个阶段最大的杠杆。可以先免费试用 1-2 个方案,对比数据广度、更新速度、文档质量后再决定。
如果你已经在做严肃研究(18 个月+):
你大概率已经踩过免费 API 的坑(停服、限流、字段缺失)。这个阶段建议你直接把数据底座迁到本地方案。一次性的迁移成本(1-2 个月)远小于继续用免费 API 的隐性成本(每月 1-2w 时间成本)。
如果你是金融从业者 / 私募研究员:
你大概率已经在用 Wind / 同花顺 iFinD / Choice 这种专业终端。这些终端的优势是机构级数据完整性 + 专业研究工具,劣势是价格贵 + 数据不能本地化。建议方案是"专业终端 + 本地数据引擎"组合——专业终端用于临时查询和跨市场研究,本地数据引擎用于长期积累和策略研究。
如果你是技术背景的量化开发者:
你最关心的是数据完整性 + API 设计 + 本地化能力。建议直接对比 ClickHouse 兼容性、parquet / csv / json 格式支持、批量导入脚本质量、数据更新延迟这些硬指标。选择能让你用最少代码完成 ETL 的方案。
十、结语:股票数据的长期价值
最后想聊一个更宏观的话题——股票数据的长期价值。
2024 年大家还在比谁的股票 API 接口多,2025 年大家开始比谁的本地数据更新快,2026 年大家开始比谁的数据更完整、更适合 AI、更能支撑长期研究。这条演进路径反映了一个核心趋势:股票数据从"工具"变成了"资产"。
工具是短期使用的,用完即弃;资产是长期积累的,越用越值钱。如果你 2026 年开始做量化研究,最有价值的决策不是"今天选哪个数据源",而是"3 年后我能不能拥有一份完整的、可追溯的、属于我自己的 A 股历史数据"。
如果你今天做出的数据选择,能让你 3 年后回头看时觉得"这是我做过的最值得的决定之一",那这个选择大概率就是对的。
希望这篇文章能帮你做出这个决定。
参考资料:本文涉及的数据接口、字段说明、性能指标,均基于本地股票数据引擎(ig50)的实际产品能力。具体数据集列表、字段定义、更新频率、价格方案,请以 ig50 官方文档为准。
资料参考:ig50.com