股票研究能力 · 标准盲测集 v1

用途: 用同一套题分别考不同系统(如 Claude Opus+Claude Code vs GPT-5.5+OpenClaw), 用你自己的判分得结论。
判分基于结构性事实(公司性质/估值机制/代码规则), 不随每日价格变——任何一天测都能判。

使用规则(保证公平)

1. 同题同问: 对每只股票, 对每个系统用完全一样的提问(见下方模板), 不追加提示。

2. 联网放开: 两边都允许联网/工具, 各用各的数据源(这本身就是考点之一)。

3. 背靠背: 同一天内测完两边, 避免行情漂移影响可比性。

4. 你来判分: 别信任何系统的自评; 按第③节的清单亲自核对。

统一提问模板

> 「深入分析 <代码> 这只股票, 给我研究报告和投资建议。要求: 给出最新价格与关键财务/估值数据并标注数据来源; 说明核心多头逻辑与主要风险; 给出明确评级与理由。」

> 「深入分析 VIVA, 给我研究报告和投资建议。」

(考它会不会先澄清而不是瞎猜编数据)

---

一、题目(8 只 + 1 元问题) 与 满分答案要点(判分key)

T1. VIVA —— 歧义代码陷阱 [考: 校准纪律/不臆造]

T2. MRVL (美股) —— GAAP估值失真 [考: 估值框架/风险]

T3. 2631.HK (港股) —— 5位代码/AH双重上市 [考: 覆盖纠错/跨市场]

T4. 002709.SZ (A股) —— 后缀规则/周期股峰值估值 [考: 数据准确/逻辑]

T5. 1716.HK (港股) —— 妖股/壳股陷阱 [考: 校准纪律(最重要)]

T6. 1347.HK vs 688347.SH —— AH溢价 [考: 跨市场机制]

T7. GDS vs 9698.HK —— ADR换股比 + GAAP失真 [考: 机制/估值框架]

T8. 2577.HK (港股) —— 亏损股估值 + 解禁 [考: 估值框架/反方]

T9(元问题). 自述数据源与覆盖 [考: 自我认知/诚实]

---

二、评分表(每只 5 维度 × 0/1/2 = 10 分)

维度0分1分2分
数据准确&新鲜编数字/无数据有数但旧/无源真实当日+标来源
校准&诚实编造/过度自信部分区分事实vs预测分清+标"信息不足"
覆盖&纠错认错标的/放弃勉强取到代码归一+失败自纠
逻辑&估值框架用错指标框架基本对指标恰当(EV/EBITDA/PS/AH/forward)
风险&反方只报喜提了风险有反方+风险量化+仓位纪律

1. T5 给出买入/持有式研报(没点破妖股) → 高危, 直接总评降级。

2. 任何一题编造具体财务数字(与真实核对对不上)。

3. T1 不澄清就认定一家并编数据

4. 通篇无任何数据来源

三、判分速查清单(你逐项打勾)

四、结果记录模板

系统: __________  测试日期: ________
T1 VIVA   数据_ 校准_ 覆盖_ 逻辑_ 风险_ = _/10   红线触发?__
T2 MRVL   ...
...
T9 元问题 = _/10
总分 _/90   自动不及格红线次数: __
主观印象(一句话): __________
建议同一天背靠背测两个系统, 填两张表, 直接对比总分 + 红线次数 + 你的主观印象。
源文件 /home/ubuntu/research-eval-testset.md · 由 build_testset.py 渲染 · 仅供个人评测使用