AI Agent实测:一个人+Codex金融Skills,能否替代投研小组?

发布时间:2026/10/2 10:55:12
AI Agent实测:一个人+Codex金融Skills,能否替代投研小组? 最近我把Codex配上一套金融Skills包连续两周做了个高强度的实测。场景很简单假设一个三人投研小组的日常工作全部交给一个人由AI来顶替另外两个人这个模式到底能不能跑通投研小组的活说到底就是读财报、查数据、建模型、写报告、做纪要这一整套执行工作。这类工作恰恰是Agent型AI最擅长的地方。我实测下来结论是方向是真的但一个人干完一个投研小组的活这句话需要重新定义——它干完的是90%的写和算的活剩下10%的判断和担责依然得靠人。这篇文章会把整个实测过程、工具配置、踩坑记录和效率对比全部拆开讲适合正在研究AI Agent落地的金融从业者也对所有想用AI提质增效的人有参考价值。1. 为什么想做这个实测投研小组的活到底有多重1.1 一个典型三人投研小组的日常工作流先还原一个典型的三人投研小组。资深分析师负责定调比如今年消费板块的核心矛盾是需求复苏还是库存出清他的时间主要花在逻辑推演和跟基金经理沟通上。研究员负责把调子落地拆财报、拉数据、搭模型、写首次覆盖报告他一周可能要同时维护4到5个公司的财务模型。助理看起来最杂但工作量一点不小每天整理行业早报、转录会议录音、维护数据库、整理路演材料。我把这个工作流拆开看真正需要脑子的部分其实只占一小部分。资深分析师的判断、研究员的逻辑推演、助理对信息重要性的敏感度这些是稀缺的。但剩下大量工作比如从财报里提数字、按模板写重点、把一万字录音变成五条会议结论本质上是高强度的结构化信息处理。一个助理做这件事一天8小时可能只能处理两份深度纪要AI做这件事一份纪要从喂进去到出结果用不了十分钟。1.2 从问答式AI到Skill式Agent的关键跨越早几年的AI助手是你问我答模式每次对话都要重新把背景交代一遍而且它给你的回答往往大而全落不了地。我让AI分析某公司财报它会把毛利率、净利率、ROE都列一遍看起来很专业但离一份能直接用的投研初稿还有十万八千里因为它不知道你的模板、你的重点、你的合规要求。Codex加上Skills之后逻辑变了。我可以把一套完整的投研方法论封装成一个技能包里面写清楚什么时候触发、用什么数据源、按什么步骤处理、最终输出什么格式。AI拿到任务后不是现场编回答而是按技能包里的流程走先拆任务再调工具最后产出结构化结果。这个模式对投研的价值不只是省时间更重要的是把团队的方法论沉淀成可复用资产。1.3 实测目标与评估维度的设计为了避免自说自话我给这次实测定了三个硬指标一是交付质量以公开财报和公开行业数据为准逐项核验AI产出的数字和结论二是耗时对比每个任务都记录从下指令到拿到成品的总时间不含前期开发和调试三是人工介入量记录每个任务中途需要人手动修正、喂补充信息、改格式的次数。测试任务全部基于公开数据和公开渠道信息合规上没有问题。所有技能包均围绕五类高频投研场景财报速读、产业链梳理、估值表生成、每日简报、会议纪要结构化。这五类场景基本覆盖了投研小组每周70%以上的执行量也是有价值去实测的对象。2. 环境搭建与Skills装载30分钟让实习生上岗2.1 Codex命令行环境的安装与版本选择首先安装Codex CLI它依赖Node.js环境建议Node版本不低于18。装完后用npm全局安装Codex包然后配置API密钥。配置密钥时我习惯把环境变量写进shell配置文件比如~/.bashrc或~/.zshrc避免每次打开新终端都要重新设置。装完以后先跑一个简单的测试任务比如让它生成一个Python脚本并执行确认端到端链路通了。版本选择上建议用当前稳定版本避免追新。实测中遇到过Node版本过旧导致命令找不到的情况最典型的就是输入codex提示command not found。那时候先去检查Node版本再检查npm全局安装路径是否加入了PATH问题基本就解决了。初次使用时如果遇到endpoint连接报错优先检查本地网络策略、防火墙和DNS配置不要盲目改系统网络设置。安装和配置大概需要20到30分钟但如果你的电脑环境比较复杂可能还要多花一点时间。第一次跑通的任务最好选一个超简单的比如打印当前时间把流程跑通了再上真实业务。2.2 金融Skills的目录结构与装载规则Skills的目录结构有一套约定。默认情况下技能包放在~/.codex/skills/目录下每个技能一个子目录子目录里至少要有一个SKILL.md文件。这个文件是技能的核心里面有frontmatter区域至少要写name和description两个字段。name是技能名称description则负责告诉AI什么时候应该使用这个技能。--- name: financial_report_analysis description: 当用户要求分析公司财务状况、阅读年报、计算估值指标或生成财务摘要时使用此技能。 ---我装金融Skills时踩过一个很典型的坑description写得太笼统比如分析财务数据结果AI经常不触发它。后来我把description改得更具体比如当用户要求分析某公司财务状况、阅读年报、计算估值指标时使用此技能触发率明显提高。另外技能包里还可以放scripts子目录让AI在任务过程中调用你写好的脚本比如一个通用的财务指标计算器这样它就不必每次现场发挥。2.3 一份能打完整投研流程的Skills包如何划分我自己在用的金融Skills包会分成五个模块财报分析、行业研究框架、估值建模、数据获取、研报模板。财报分析模块负责读数据、算指标、写摘要行业研究框架模块内置产业链分析、竞争格局分析模板估值建模模块负责拉取公开行情数据并计算PE、PB、EV/EBITDA数据获取模块封装了多个公开数据源的读取脚本研报模板模块提供输出格式模板包括首次覆盖报告、跟踪点评、每日早报等。这套划分的价值在于复用。团队的方法论、格式要求、数据口径全部沉淀在技能包里换谁来操作输出都是同一个风格。对于一个人单挑所有投研工作的情况这套技能的完善程度直接决定了你能省多少时间。3. 五个高负荷投研场景逐一跑输入输出全实录3.1 场景一上市公司财报速读与风险清单生成第一个实测场景是财报速读。我选了一家A股消费类上市公司2023年的年度报告一共600多页PDF再加一份财务摘要Excel当作辅助数据。指令很简单使用财报分析技能完成一份速读摘要包括收入拆解、毛利率变化、三项费用、经营性现金流、应收账款、存货周转、资产负债率变化并列出你认为的五大风险点。实测结果从下指令到拿到摘要耗时约20分钟。输出是一份约3000字的结构化摘要数据完整度很高关键指标和财报原文基本能对上。但人工复核时发现两处应收账款增速的表述需要修正AI把同比增长和环比增长混用了。风险清单部分AI偏向使用年报原文的委婉措辞缺乏主动质疑。整体评价这是一个完全可以交给AI做的场景但最后一定要有人通读一遍。3.2 场景二行业产业链梳理第二个场景是产业链梳理。我要求AI基于公开行业白皮书和公开资料输出某消费细分行业的全景梳理包括上游原料、中游制造、下游渠道标出每个环节的毛利率区间、主要参与者和竞争格局。这是一个典型的框架信息填充型任务非常适合交给AI打底稿。实测中AI输出了一份结构清晰的Markdown文档产业链逻辑完整各环节的关键公司和大致毛利区间也列出来了。但问题出在毛利率数据上AI给的几个数值和公开财报口径对不上。后来我追加了一条指令要求所有数据必须给出具体来源和引用日期输出才变得可用。所以在这个场景里AI最合适的定位是骨架生成器最后一公里的数据核验还得靠自己。3.3 场景三可比公司估值表自动生成第三个场景最能体现Agent的干活属性。我给出一组可比公司名单要求用公开行情数据自行编写Python脚本拉取最近收盘价、总股本、净利润等数据计算PE、PB、EV/EBITDA输出一组对比表。这一步交给传统聊天AI会非常痛苦因为它只会教你自己去网站查但Codex可以直接写脚本、执行脚本、迭代修正。实测中它第一次生成的脚本就跑通了数据也拉下来了表格结构规范。唯一的问题是净利润口径AI默认用了归母净利润而我需要的是扣非净利润两者对某些公司差异很大。我手动改了一行计算逻辑后重新跑结果就符合要求了。这个场景的启示是AI可以帮你完成80%的算数工作但口径定义这种带有专业判断的细节必须人在前面定清楚。3.4 场景四每日投研简报自动生成每日简报是我认为最适合自动化的场景没有之一。它高度重复、格式固定、时效性强。我在技能包里配置了一个每日简报的工作流早上触发后自动拉取公开财经新闻标题按行业分类提取与关注标的相关的条目最后输出一份带时间戳的早报文档。实测体验每天早上只需要输入一句生成今日投研简报大约5分钟后台任务完成格式稳定、内容完整。它的短板也很明显AI只会做聚合和分类不会判断哪条新闻真正重要。我只保留跟关注公司名单和关键词匹配的条目解决了部分噪音问题。如果未来能接入更智能的排序规则这个场景基本上能做到完全无人值守。3.5 场景五会议纪要转结构化决策清单最后是会议纪要场景。我把一段投资讨论会的录音转写文本喂给AI要求整理为会议纪要提炼最终结论、分歧点、行动项每个行动项标注负责人和截止时间。这个任务测试的是AI对口语信息做结构化提取的能力。实测结果很惊喜结论和行动项提取准确度非常高因为发言人在讨论中往往会把关键信息说得很明确AI只需要准确识别。但遇到口语化的表达、双关语和保留态度的措辞时AI会过于直译导致语气失真。比如有人用开玩笑的语气说要不这事就黄了吧AI会提取成建议终止项目。所以纪要这个场景可以让AI做初稿但语气和潜在意图必须人工过一遍。4. 一个人 vs 一个小组效率账与质量账怎么算4.1 时间与人力成本对比一份真实任务清单把三天实测里的任务量汇总一下三份财报速读、两份产业链梳理、五张估值表、三份每日简报、八份会议纪要。传统三人小组完成这些任务按行业内正常速度估计大约需要40个工时。用我配好Skills的Codex实测包含所有人工修正的时间总共大约是12小时。也就是说效率提升在3倍以上。任务人工典型耗时AI实测耗时人工修正时间财报速读600页年报6小时20分钟30分钟产业链梳理8小时15分钟1小时可比公司估值表4小时10分钟20分钟每日投研简报1.5小时5分钟10分钟会议纪要转结构化1小时/份8分钟/份15分钟/份需要说明的是这12个小时里有相当一部分是前期的技能包调试和数据源接入这部分是一次性投入越往后摊销越薄。如果你想复现这个效率不能只装个Codex就开始用技能包的完善度才是关键变量。4.2 质量评估AI产出的长板与短板效率提升是一回事质量能不能打是另一回事。我逐项核对了AI产出的数据准确性发现它的长板集中在格式统一性极强同一份模板无论跑几次结构永远稳定覆盖面完整一份财报摘要里几乎所有重要科目都会被提到不会像人类分析师那样偶尔漏项速度就是优势当市场出现异动需要快速更新数据时人工往往手忙脚乱AI则按部就班十秒出结果。短板也非常明确第一它没有真正的观点只会总结而不会下判断第二存在幻觉问题如果数据源缺失它可能会编造一个看起来合理的数字第三它不理解潜台词新闻背后的利益关系、语气暗示、真实的资金动向都需要人来补第四它对什么值得写缺乏优先级判断经常把重要信息埋在无关紧要的细节里。4.3 哪些环节必须留给人脑一条边界清单投研工作里有些动作不能外包。第一最终投资结论要不要买、买多少、什么时候卖这种带资金后果的决策必须人工负责第二数据口径和合规审核任何对外发布的材料AI只能当草稿最终风险要人背第三与客户和内部投资经理的沟通这种需要建立信任、处理情绪的场景AI无法替代第四对突发新闻的第一反应AI的响应速度虽然快但它无法理解这条新闻在当下持仓结构里意味着什么。我给自己的定位是AI是那个每天能出十份初稿的高强度研究员助理我是那个说这里重点写这个风险要展开的主编。它的工作是压缩信息我的工作是判断什么信息重要。5. 实操避坑全记录我在实测中踩过的坑5.1 安装与运行环境问题第一坑Node版本过旧。我的开发机之前一直用的是Node 16装完Codex后命令根本调不起来查了半天发现是版本不支持。升级到Node 18之后一切正常。第二坑环境变量配置没写进shell配置文件重启终端后密钥全部丢失导致每次都要重新填后来把export写进~/.zshrc才解决。第三坑npm安装超时建议把npm registry配置成国内镜像源速度会稳定很多。第四坑如果你遇到endpoint连接失败之类的问题先检查本地网络策略、防火墙和DNS配置而不是去改系统网络开关。这类问题多半是环境导致的不是工具本身的问题。5.2 Skills不触发与路径配置错误Skills不触发是使用过程中最让人头疼的问题。我总结下来主要有三个原因一是技能目录放错了位置没有放进~/.codex/skills/二是SKILL.md里的frontmatter字段名写错比如description拼写问题导致AI无法识别三是description写得太宽泛AI在判断该不该用这个技能时犹豫最后干脆不用。排查顺序建议从外到内先确认技能包所在目录被Codex正确识别再检查SKILL.md的格式和字段最后把description改得更具体。这里有个实用技巧在description里明确写当用户遇到以下情况时必须使用此技能并附上一到两个典型问题示例触发率会明显提高。5.3 数据抓取失败与幻觉数据校验投研对数字准确性要求极高AI的幻觉问题在这里会被无限放大。我实测中遇到两次AI在数据源缺失时编出了财务数字而且编得很像真的如果不是人工核验很容易混进报告。所以我的铁律是AI输出的任何关键财务数字必须与原始财报或公开数据库核对关键指标宁可核三遍。年报PDF解析是另一个坑。直接喂PDF容易导致解析乱码更稳妥的做法是先把PDF转成文本或者直接用结构化数据文件Excel、CSV喂给模型。抓取公开网站时优先选择官方API和公开数据包而不是直接抓网页既稳定又不容易触发反爬。5.4 长任务中断与上下文丢失跑长任务时Codex偶尔会因为超时或上下文长度到上限而中断。最尴尬的是任务跑到一半停了前面已经产出的中间结果也丢了。我的对策是大任务拆小步每一步保存中间结果。比如产业链梳理我会分成搭框架→填上游→填中游→填下游四个步骤每步单独跑、单独存档即使某一步失败也只是局部重来。还有一个小经验复杂任务的指令用结构化描述更稳定。把目标、输入、输出格式、注意事项分成四行写清楚比一段长篇大论的要可靠得多。实测下来这种结构化的任务拆解能让失败率下降一半以上。5.5 合规红线与专业边界必须提前想清楚的事金融场景天生的合规敏感度要求我们对AI的使用范围有明确边界。第一只使用公开数据与合法授权数据源不要把未公开信息喂给模型第二AI产出的内容不应直接作为投资建议对外发布它只能作为内部研究参考的辅助材料第三对外发布的任何内容必须人工审核建议在文档末尾统一加上由AI辅助生成仅供研究参考的说明这是既保护自己也保护公司的习惯。这些边界不是限制反而能让AI用得更持久。在一个明确有边界的框架里使用Agent比什么都不管就用长远来看更稳。6. 我的最终判断这句话真在哪里、假在哪里让我直接说结论。实测两周、五类场景、几十项任务之后我认为一个人干完一个投研小组的活这句话在特定前提下是真的但需要把话术修正一下一个人加上一套配置良好的Codex和金融Skills可以完成一个投研小组90%的执行型工作包括数据拉取、财务分析、模型计算、报告初稿、会议纪要但剩下10%的判断层工作包括投资结论、风险定性、客户沟通、合规兜底必须也只能由人完成。我的个人感受是这个组合最大的价值不是替代人而是把投研工作从劳动密集型变成了判断密集型。以前一个小组用40个工时把数据整理干净才能挤出5个小时做真正有价值的判断。现在这些数据整理工作被压缩到几个小时你可以用省下来的时间反复推敲同一个关键逻辑。如果你也想在自己的团队里做类似的事我的建议是从一个高频、可衡量的场景切入比如每日投研简报或会议纪要先把流程跑顺再逐步扩展。工具不是核心你对业务流程的理解才是核心。