news 2026/10/2 10:55:09

AI Agent实测:一个人+Codex金融Skills,能否替代投研小组?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI Agent实测:一个人+Codex金融Skills,能否替代投研小组?

最近我把Codex配上一套金融Skills包,连续两周做了个高强度的实测。场景很简单:假设一个三人投研小组的日常工作全部交给一个人,由AI来顶替另外两个人,这个模式到底能不能跑通?投研小组的活,说到底就是"读财报、查数据、建模型、写报告、做纪要"这一整套执行工作。这类工作恰恰是Agent型AI最擅长的地方。我实测下来,结论是:方向是真的,但"一个人干完一个投研小组的活"这句话,需要重新定义——它干完的是90%的"写和算"的活,剩下10%的"判断和担责"依然得靠人。这篇文章会把整个实测过程、工具配置、踩坑记录和效率对比全部拆开讲,适合正在研究AI Agent落地的金融从业者,也对所有想用AI提质增效的人有参考价值。

1. 为什么想做这个实测:投研小组的活到底有多重

1.1 一个典型三人投研小组的日常工作流

先还原一个典型的三人投研小组。资深分析师负责定调,比如"今年消费板块的核心矛盾是需求复苏还是库存出清",他的时间主要花在逻辑推演和跟基金经理沟通上。研究员负责把调子落地,拆财报、拉数据、搭模型、写首次覆盖报告,他一周可能要同时维护4到5个公司的财务模型。助理看起来最杂,但工作量一点不小:每天整理行业早报、转录会议录音、维护数据库、整理路演材料。

我把这个工作流拆开看,真正需要"脑子"的部分,其实只占一小部分。资深分析师的判断、研究员的逻辑推演、助理对信息重要性的敏感度,这些是稀缺的。但剩下大量工作,比如从财报里提数字、按模板写重点、把一万字录音变成五条会议结论,本质上是"高强度的结构化信息处理"。一个助理做这件事,一天8小时可能只能处理两份深度纪要;AI做这件事,一份纪要从喂进去到出结果,用不了十分钟。

1.2 从问答式AI到Skill式Agent的关键跨越

早几年的AI助手是"你问我答"模式,每次对话都要重新把背景交代一遍,而且它给你的回答往往大而全,落不了地。我让AI"分析某公司财报",它会把毛利率、净利率、ROE都列一遍,看起来很专业,但离一份能直接用的投研初稿还有十万八千里,因为它不知道你的模板、你的重点、你的合规要求。

Codex加上Skills之后,逻辑变了。我可以把一套完整的投研方法论封装成一个"技能包":里面写清楚什么时候触发、用什么数据源、按什么步骤处理、最终输出什么格式。AI拿到任务后,不是现场编回答,而是按技能包里的流程走:先拆任务,再调工具,最后产出结构化结果。这个模式对投研的价值,不只是"省时间",更重要的是把团队的方法论沉淀成可复用资产。

1.3 实测目标与评估维度的设计

为了避免自说自话,我给这次实测定了三个硬指标:一是交付质量,以公开财报和公开行业数据为准,逐项核验AI产出的数字和结论;二是耗时对比,每个任务都记录从下指令到拿到成品的总时间,不含前期开发和调试;三是人工介入量,记录每个任务中途需要人手动修正、喂补充信息、改格式的次数。

测试任务全部基于公开数据和公开渠道信息,合规上没有问题。所有技能包均围绕五类高频投研场景:财报速读、产业链梳理、估值表生成、每日简报、会议纪要结构化。这五类场景基本覆盖了投研小组每周70%以上的执行量,也是有价值去实测的对象。

2. 环境搭建与Skills装载:30分钟让"实习生"上岗

2.1 Codex命令行环境的安装与版本选择

首先安装Codex CLI,它依赖Node.js环境,建议Node版本不低于18。装完后用npm全局安装Codex包,然后配置API密钥。配置密钥时我习惯把环境变量写进shell配置文件,比如~/.bashrc或~/.zshrc,避免每次打开新终端都要重新设置。装完以后先跑一个简单的测试任务,比如让它生成一个Python脚本并执行,确认端到端链路通了。

版本选择上,建议用当前稳定版本,避免追新。实测中遇到过Node版本过旧导致命令找不到的情况,最典型的就是输入codex提示"command not found"。那时候先去检查Node版本,再检查npm全局安装路径是否加入了PATH,问题基本就解决了。初次使用时如果遇到endpoint连接报错,优先检查本地网络策略、防火墙和DNS配置,不要盲目改系统网络设置。

安装和配置大概需要20到30分钟,但如果你的电脑环境比较复杂,可能还要多花一点时间。第一次跑通的任务最好选一个超简单的,比如"打印当前时间",把流程跑通了再上真实业务。

2.2 金融Skills的目录结构与装载规则

Skills的目录结构有一套约定。默认情况下,技能包放在~/.codex/skills/目录下,每个技能一个子目录,子目录里至少要有一个SKILL.md文件。这个文件是技能的核心,里面有frontmatter区域,至少要写name和description两个字段。name是技能名称,description则负责告诉AI"什么时候应该使用这个技能"。

--- name: financial_report_analysis description: 当用户要求分析公司财务状况、阅读年报、计算估值指标或生成财务摘要时,使用此技能。 ---

我装金融Skills时踩过一个很典型的坑:description写得太笼统,比如"分析财务数据",结果AI经常不触发它。后来我把description改得更具体,比如"当用户要求分析某公司财务状况、阅读年报、计算估值指标时,使用此技能",触发率明显提高。另外,技能包里还可以放scripts子目录,让AI在任务过程中调用你写好的脚本,比如一个通用的财务指标计算器,这样它就不必每次现场发挥。

2.3 一份能打完整投研流程的Skills包如何划分

我自己在用的金融Skills包会分成五个模块:财报分析、行业研究框架、估值建模、数据获取、研报模板。财报分析模块负责读数据、算指标、写摘要;行业研究框架模块内置产业链分析、竞争格局分析模板;估值建模模块负责拉取公开行情数据并计算PE、PB、EV/EBITDA;数据获取模块封装了多个公开数据源的读取脚本;研报模板模块提供输出格式模板,包括首次覆盖报告、跟踪点评、每日早报等。

这套划分的价值在于复用。团队的方法论、格式要求、数据口径,全部沉淀在技能包里,换谁来操作,输出都是同一个风格。对于一个人单挑所有投研工作的情况,这套技能的完善程度直接决定了你能省多少时间。

3. 五个高负荷投研场景逐一跑:输入输出全实录

3.1 场景一:上市公司财报速读与风险清单生成

第一个实测场景是财报速读。我选了一家A股消费类上市公司2023年的年度报告,一共600多页PDF,再加一份财务摘要Excel当作辅助数据。指令很简单:"使用财报分析技能,完成一份速读摘要,包括收入拆解、毛利率变化、三项费用、经营性现金流、应收账款、存货周转、资产负债率变化,并列出你认为的五大风险点。"

实测结果:从下指令到拿到摘要,耗时约20分钟。输出是一份约3000字的结构化摘要,数据完整度很高,关键指标和财报原文基本能对上。但人工复核时发现两处应收账款增速的表述需要修正,AI把"同比增长"和"环比增长"混用了。风险清单部分,AI偏向使用年报原文的委婉措辞,缺乏主动质疑。整体评价:这是一个完全可以交给AI做的场景,但最后一定要有人通读一遍。

3.2 场景二:行业产业链梳理

第二个场景是产业链梳理。我要求AI基于公开行业白皮书和公开资料,输出某消费细分行业的全景梳理,包括上游原料、中游制造、下游渠道,标出每个环节的毛利率区间、主要参与者和竞争格局。这是一个典型的"框架+信息填充"型任务,非常适合交给AI打底稿。

实测中AI输出了一份结构清晰的Markdown文档,产业链逻辑完整,各环节的关键公司和大致毛利区间也列出来了。但问题出在毛利率数据上:AI给的几个数值和公开财报口径对不上。后来我追加了一条指令,要求所有数据必须给出具体来源和引用日期,输出才变得可用。所以在这个场景里,AI最合适的定位是骨架生成器,最后一公里的数据核验还得靠自己。

3.3 场景三:可比公司估值表自动生成

第三个场景最能体现Agent的"干活"属性。我给出一组可比公司名单,要求用公开行情数据自行编写Python脚本,拉取最近收盘价、总股本、净利润等数据,计算PE、PB、EV/EBITDA,输出一组对比表。这一步交给传统聊天AI会非常痛苦,因为它只会教你自己去网站查,但Codex可以直接写脚本、执行脚本、迭代修正。

实测中它第一次生成的脚本就跑通了,数据也拉下来了,表格结构规范。唯一的问题是净利润口径:AI默认用了归母净利润,而我需要的是扣非净利润,两者对某些公司差异很大。我手动改了一行计算逻辑后重新跑,结果就符合要求了。这个场景的启示是:AI可以帮你完成80%的算数工作,但"口径定义"这种带有专业判断的细节,必须人在前面定清楚。

3.4 场景四:每日投研简报自动生成

每日简报是我认为最适合自动化的场景,没有之一。它高度重复、格式固定、时效性强。我在技能包里配置了一个每日简报的工作流:早上触发后,自动拉取公开财经新闻标题,按行业分类,提取与关注标的相关的条目,最后输出一份带时间戳的早报文档。

实测体验:每天早上只需要输入一句"生成今日投研简报",大约5分钟后台任务完成,格式稳定、内容完整。它的短板也很明显:AI只会做"聚合和分类",不会判断哪条新闻真正重要。我只保留跟关注公司名单和关键词匹配的条目,解决了部分噪音问题。如果未来能接入更智能的排序规则,这个场景基本上能做到完全无人值守。

3.5 场景五:会议纪要转结构化决策清单

最后是会议纪要场景。我把一段投资讨论会的录音转写文本喂给AI,要求整理为会议纪要,提炼最终结论、分歧点、行动项,每个行动项标注负责人和截止时间。这个任务测试的是AI对口语信息做结构化提取的能力。

实测结果很惊喜:结论和行动项提取准确度非常高,因为发言人在讨论中往往会把关键信息说得很明确,AI只需要准确识别。但遇到口语化的表达、双关语和保留态度的措辞时,AI会过于直译,导致语气失真。比如有人用开玩笑的语气说"要不这事就黄了吧",AI会提取成"建议终止项目"。所以纪要这个场景,可以让AI做初稿,但语气和潜在意图必须人工过一遍。

4. 一个人 vs 一个小组:效率账与质量账怎么算

4.1 时间与人力成本对比:一份真实任务清单

把三天实测里的任务量汇总一下:三份财报速读、两份产业链梳理、五张估值表、三份每日简报、八份会议纪要。传统三人小组完成这些任务,按行业内正常速度估计,大约需要40个工时。用我配好Skills的Codex实测,包含所有人工修正的时间,总共大约是12小时。也就是说,效率提升在3倍以上。

任务人工典型耗时AI实测耗时人工修正时间
财报速读(600页年报)6小时20分钟30分钟
产业链梳理8小时15分钟1小时
可比公司估值表4小时10分钟20分钟
每日投研简报1.5小时5分钟10分钟
会议纪要转结构化1小时/份8分钟/份15分钟/份

需要说明的是,这12个小时里有相当一部分是前期的技能包调试和数据源接入,这部分是一次性投入,越往后摊销越薄。如果你想复现这个效率,不能只装个Codex就开始用,技能包的完善度才是关键变量。

4.2 质量评估:AI产出的长板与短板

效率提升是一回事,质量能不能打是另一回事。我逐项核对了AI产出的数据准确性,发现它的长板集中在:格式统一性极强,同一份模板无论跑几次,结构永远稳定;覆盖面完整,一份财报摘要里几乎所有重要科目都会被提到,不会像人类分析师那样偶尔漏项;速度就是优势,当市场出现异动需要快速更新数据时,人工往往手忙脚乱,AI则按部就班十秒出结果。

短板也非常明确:第一,它没有真正的观点,只会"总结"而不会"下判断";第二,存在幻觉问题,如果数据源缺失,它可能会编造一个看起来合理的数字;第三,它不理解"潜台词",新闻背后的利益关系、语气暗示、真实的资金动向,都需要人来补;第四,它对"什么值得写"缺乏优先级判断,经常把重要信息埋在无关紧要的细节里。

4.3 哪些环节必须留给人脑:一条边界清单

投研工作里,有些动作不能外包。第一,最终投资结论,要不要买、买多少、什么时候卖,这种带资金后果的决策必须人工负责;第二,数据口径和合规审核,任何对外发布的材料,AI只能当草稿,最终风险要人背;第三,与客户和内部投资经理的沟通,这种需要建立信任、处理情绪的场景,AI无法替代;第四,对突发新闻的第一反应,AI的响应速度虽然快,但它无法理解这条新闻在当下持仓结构里意味着什么。

我给自己的定位是:AI是那个每天能出十份初稿的高强度研究员助理,我是那个说"这里重点写""这个风险要展开"的主编。它的工作是压缩信息,我的工作是判断什么信息重要。

5. 实操避坑全记录:我在实测中踩过的坑

5.1 安装与运行环境问题

第一坑,Node版本过旧。我的开发机之前一直用的是Node 16,装完Codex后命令根本调不起来,查了半天发现是版本不支持。升级到Node 18之后一切正常。第二坑,环境变量配置没写进shell配置文件,重启终端后密钥全部丢失,导致每次都要重新填,后来把export写进~/.zshrc才解决。第三坑,npm安装超时,建议把npm registry配置成国内镜像源,速度会稳定很多。第四坑,如果你遇到endpoint连接失败之类的问题,先检查本地网络策略、防火墙和DNS配置,而不是去改系统网络开关。这类问题多半是环境导致的,不是工具本身的问题。

5.2 Skills不触发与路径配置错误

Skills不触发是使用过程中最让人头疼的问题。我总结下来主要有三个原因:一是技能目录放错了位置,没有放进~/.codex/skills/;二是SKILL.md里的frontmatter字段名写错,比如description拼写问题,导致AI无法识别;三是description写得太宽泛,AI在判断"该不该用这个技能"时犹豫,最后干脆不用。

排查顺序建议从外到内:先确认技能包所在目录被Codex正确识别,再检查SKILL.md的格式和字段,最后把description改得更具体。这里有个实用技巧:在description里明确写"当用户遇到以下情况时必须使用此技能",并附上一到两个典型问题示例,触发率会明显提高。

5.3 数据抓取失败与幻觉数据校验

投研对数字准确性要求极高,AI的幻觉问题在这里会被无限放大。我实测中遇到两次AI在数据源缺失时"编"出了财务数字,而且编得很像真的,如果不是人工核验,很容易混进报告。所以我的铁律是:AI输出的任何关键财务数字,必须与原始财报或公开数据库核对,关键指标宁可核三遍。

年报PDF解析是另一个坑。直接喂PDF容易导致解析乱码,更稳妥的做法是先把PDF转成文本,或者直接用结构化数据文件(Excel、CSV)喂给模型。抓取公开网站时,优先选择官方API和公开数据包,而不是直接抓网页,既稳定又不容易触发反爬。

5.4 长任务中断与上下文丢失

跑长任务时,Codex偶尔会因为超时或上下文长度到上限而中断。最尴尬的是任务跑到一半停了,前面已经产出的中间结果也丢了。我的对策是:大任务拆小步,每一步保存中间结果。比如产业链梳理,我会分成"搭框架→填上游→填中游→填下游"四个步骤,每步单独跑、单独存档,即使某一步失败,也只是局部重来。

还有一个小经验:复杂任务的指令用结构化描述更稳定。把目标、输入、输出格式、注意事项分成四行写清楚,比一段长篇大论的要可靠得多。实测下来,这种结构化的任务拆解能让失败率下降一半以上。

5.5 合规红线与专业边界:必须提前想清楚的事

金融场景天生的合规敏感度要求我们对AI的使用范围有明确边界。第一,只使用公开数据与合法授权数据源,不要把未公开信息喂给模型;第二,AI产出的内容不应直接作为投资建议对外发布,它只能作为内部研究参考的辅助材料;第三,对外发布的任何内容必须人工审核,建议在文档末尾统一加上"由AI辅助生成,仅供研究参考"的说明,这是既保护自己也保护公司的习惯。

这些边界不是限制,反而能让AI用得更持久。在一个明确有边界的框架里使用Agent,比什么都不管就用,长远来看更稳。

6. 我的最终判断:这句话真在哪里、假在哪里

让我直接说结论。实测两周、五类场景、几十项任务之后,我认为"一个人干完一个投研小组的活"这句话,在特定前提下是真的,但需要把话术修正一下:一个人加上一套配置良好的Codex和金融Skills,可以完成一个投研小组90%的执行型工作,包括数据拉取、财务分析、模型计算、报告初稿、会议纪要;但剩下10%的判断层工作,包括投资结论、风险定性、客户沟通、合规兜底,必须也只能由人完成。

我的个人感受是,这个组合最大的价值不是"替代人",而是把投研工作从劳动密集型变成了判断密集型。以前一个小组用40个工时把数据整理干净,才能挤出5个小时做真正有价值的判断。现在这些数据整理工作被压缩到几个小时,你可以用省下来的时间反复推敲同一个关键逻辑。如果你也想在自己的团队里做类似的事,我的建议是从一个高频、可衡量的场景切入,比如每日投研简报或会议纪要,先把流程跑顺,再逐步扩展。工具不是核心,你对业务流程的理解才是核心。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 10:53:55

AI工程从零开始:裸机部署到边缘推理的七层实战

1. 这不是“搭积木”,而是亲手锻造AI系统的完整工程链“ai-engineering-from-scratch”这个标题,乍看像一句技术口号,但在我带过二十多个工业级AI项目、亲手从零部署过七套生产环境之后,它其实是一张沉甸甸的工程路线图——不是调…

作者头像 李华
网站建设 2026/10/2 10:53:11

浙江聚氨酯垫块加工厂哪家好?河北科冶橡塑科技综合实力推荐

浙江聚氨酯垫块加工厂哪家好?河北科冶橡塑科技综合实力推荐河北科冶橡塑科技有限公司(简称科冶橡塑)是一家专业从事橡胶制品、聚氨酯制品生产与加工的实体制造企业,主打聚氨酯包胶轮、金属件包胶、聚氨酯垫块等核心产品。一句话定位:以高强度弹性缓冲构…

作者头像 李华
网站建设 2026/10/2 10:53:11

RAG与Wiki结合:让企业知识库从被动翻阅到主动智能应答

1. 先说清楚:RAG 和 Wiki 各自解决什么问题 1.1 RAG 解决“找答案”的痛 我在过去一年多里反复被问到同一个问题:“我已经有了公司内部的 Wiki,但没人去看,一问事情还是得私聊,有没有办法让它自动回答?” 这个诉求的本质,是“找答案”的成本太高。你可能有几百篇文档、几千个…

作者头像 李华
网站建设 2026/10/2 10:52:37

OpenShell:Windows资源管理器的macOS+WSL体验重构

1. OpenShell 不是 Shell,而是 Windows 上的“类 macOS 终端体验重构工程”很多人第一次看到OpenShell这个名字,下意识会以为它是 Linux 或 macOS 那种开源 shell(比如 zsh、fish)的某个新分支,甚至有人搜“OpenShell …

作者头像 李华
网站建设 2026/10/2 10:51:38

CRM系统建设蓝图汇报方案:从现状调研到ROI落地的完整指南

简介:面向企业信息化负责人、项目经理及CRM从业者的企业CRM系统建设蓝图汇报文档,提供从需求调研、蓝图设计到实施方案制定的完整参考,帮助厘清客户信息管理、营销体系、售后服务等核心模块的落地路径。资源为单个PDF文件,约6.48M…

作者头像 李华
网站建设 2026/10/2 10:50:18

AI大模型Skills完全指南:从SKILL.md到Agent实战,一篇就够了!

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华