67 / 84次保留运行触发评分上限。上限只约束最终得分,不额外赋分。
Toneme · 金融 Agent 训练与评估数据
金融 Agent RL 环境
面向后训练与评测的金融 Agent 任务样例,配套提供源文件、可执行工作流与奖励评估组件。下方真实运行记录展示环境的实际表现。
欢迎联系,了解私有评估包或更完整的任务集。
- 任务
- 14
- 题型
- 6
- 模型
- 2
- 保留运行
- 84
任务级最终得分分布
得分 / 100- DCF 与经营模型
- 20.00
- 杠杆收购
- 13.50
- 现金流
- 28.50
- 贷款资产池
- 10.00
- 并购与融资
- 9.34
- IRR 与可比分析
- 19.68
下须线 / Q1 / 中位数 / Q3 / 上须线
6.23 / 10.61 / 15.00 / 20.50 / 29.08
- DCF 与经营模型
- 46.59
- 杠杆收购
- 24.21
- 现金流
- 27.22
- 贷款资产池
- 62.50
- 并购与融资
- 41.00
- IRR 与可比分析
- 38.85
下须线 / Q1 / 中位数 / Q3 / 上须线
12.57 / 25.00 / 25.00 / 42.37 / 68.19
每个观测值是一道任务的保留运行均分。箱体表示第 25–75 百分位,中线为中位数;须线延伸至 1.5 倍四分位距范围内最远的实际得分,空心圆标出离群任务。数值标签为各任务等权后的总体均分。
01 / 查看真实任务
从得分走进真实交付。
LNG 估值
为 LNG 接收站构建联动三表预测、DCF 估值与敏感性分析。
要求交付物
由公式驱动的金融工作簿与结构化输出
展开查看脱敏利润表
| 项目 | 第3年(实际) | 第4年(预测) | 第5年(预测) | 第6年(预测) | 第7年(预测) | 第8年(预测) | 第9年(预测) |
|---|---|---|---|---|---|---|---|
| 核心业务 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 储存业务 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 辅助业务 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 收入 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 经营成本 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 附加费 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 调度 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 一般及行政费用 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 其他经营项目 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 息税折旧摊销前利润 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 折旧 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 摊销 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 息税前利润 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 现金利息 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
| 存款收益 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 | 已隐藏 |
02 / 工作流覆盖
六类工作流,各有难点。
各工作流平均最终得分
类别内任务等权尚未评测。
各类任务数量不同。总体成绩按任务等权,不按类别等权;缺失结果不记零分。
3次保留运行获得满分。成功案例与受限结果均予展示。
14个任务环境将可执行工作流与结构化奖励评估配套交付。
03 / 更多样例
交付成果,哪些还未达标?
02 / 运营估值
预测必须随输入变化。
为购物中心构建综合运营预测与估值。
要求交付物
联动运营预测与估值工作簿
因果性检查约束所得分数
选定的 Astra 提交在应用上限前获得 36.46 分。记录中的检查未检测到真实数值因果关系,触发 25 分上限,最终得分降至 25.00。
- 自然得分
- 36.46
- 最终得分
- 25.00
- 得分上限
- 25.00
GPT-6 Astra · 运行 1 · 评分回执摘录
本次选定提交展示特定评分约束,不构成一般能力排名,也不替代下方完整结果。
03 / 资本预算
上限并不授予其下方的分数。
根据给定表格输入与输出约定,构建新的可审计资本预算工作簿。
要求交付物
可审计资本预算工作簿与结构化输出
应用上限后低分仍保持低分
保留Astra提交的得分仍低于25分上限。记录的检查未检测到所需数值因果关系。应用上限后保留较低的实际得分,而不是自动授予25分。
- 自然得分
- 10.95
- 最终得分
- 10.95
- 得分上限
- 25.00
GPT-6 Astra · 运行 1 · 评分回执摘录
此案例说明得分上限与实际获得分数的区别,不是一次新的模型运行。
04 / 观察一次实际运行
执行轨迹
观察六次选定执行从记录动作到保留结果的过程。这些实例用于展示过程,并非类别平均轨迹或最佳案例。
该轨迹加载失败,其他评测结果仍可查看。
“时长”展示相邻记录事件的间隔,不拆分模型推理与工具执行时间;“轮次”对应记录中的 Agent 步骤。颜色按已核对的动作语义分组。进度检查读取已有进程状态,暂停表示记录中的等待。动作摘要已经脱敏,运行中的校验不等同于私有最终评分。
05 / 检查证据
保留结果
01DCF 与经营模型GPT-5.6 Sol20.002/2 任务 · 6/6 次触发上限GPT-6 Astra46.592/2 任务 · 3/6 次触发上限
| 任务 | 模型 | 平均得分 | 触发上限 | 运行证据 |
|---|---|---|---|---|
| 建立联动的LNG预测、DCF估值与敏感性分析。 | GPT-5.6 Sol | 15.00 | 3/3 | 查看各次运行运行 1 · 10.00 自然得分: 21.26 有效保留提交 运行 2 · 25.00 自然得分: 43.79 有效保留提交 运行 3 · 10.00 自然得分: 28.15 有效保留提交 |
| 为购物中心建立一体化运营预测与估值。 | GPT-5.6 Sol | 25.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 31.87 有效保留提交 运行 2 · 25.00 自然得分: 32.01 有效保留提交 运行 3 · 25.00 自然得分: 34.69 有效保留提交 |
| 建立联动的LNG预测、DCF估值与敏感性分析。 | GPT-6 Astra | 68.19 | 0/3 | 查看各次运行运行 1 · 75.52 自然得分: 75.52 有效保留提交 运行 2 · 72.00 自然得分: 72.00 有效保留提交 · 获准替换 运行 3 · 57.05 自然得分: 57.05 有效保留提交 |
| 为购物中心建立一体化运营预测与估值。 | GPT-6 Astra | 25.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 36.46 有效保留提交 运行 2 · 25.00 自然得分: 33.79 有效保留提交 运行 3 · 25.00 自然得分: 35.72 有效保留提交 |
02杠杆收购GPT-5.6 Sol13.504/4 任务 · 12/12 次触发上限GPT-6 Astra24.214/4 任务 · 12/12 次触发上限
| 任务 | 模型 | 平均得分 | 触发上限 | 运行证据 |
|---|---|---|---|---|
| 对杠杆收购的收购融资、运营情景与投资方回报建模。 | GPT-5.6 Sol | 12.65 | 3/3 | 查看各次运行运行 1 · 10.00 自然得分: 21.27 有效保留提交 运行 2 · 10.00 自然得分: 14.78 有效保留提交 运行 3 · 17.95 自然得分: 17.95 有效保留提交 |
| 检索所需财务证据并用于联动的收购模型。 | GPT-5.6 Sol | 10.00 | 3/3 | 查看各次运行运行 1 · 10.00 自然得分: 18.38 有效保留提交 运行 2 · 10.00 自然得分: 32.94 有效保留提交 运行 3 · 10.00 自然得分: 19.68 有效保留提交 |
| 建立联动融资、运营与回报计算的收购模型。 | GPT-5.6 Sol | 16.37 | 3/3 | 查看各次运行运行 1 · 10.00 自然得分: 26.46 有效保留提交 运行 2 · 19.74 自然得分: 19.74 有效保留提交 运行 3 · 19.36 自然得分: 19.36 有效保留提交 |
| 检索来源财务信息并关联至要求的收购模型输出。 | GPT-5.6 Sol | 15.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 30.88 有效保留提交 运行 2 · 10.00 自然得分: 13.82 有效保留提交 运行 3 · 10.00 自然得分: 10.53 有效保留提交 |
| 对杠杆收购的收购融资、运营情景与投资方回报建模。 | GPT-6 Astra | 25.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 33.21 有效保留提交 运行 2 · 25.00 自然得分: 27.86 有效保留提交 运行 3 · 25.00 自然得分: 25.96 有效保留提交 |
| 检索所需财务证据并用于联动的收购模型。 | GPT-6 Astra | 24.14 | 3/3 | 查看各次运行运行 1 · 23.58 自然得分: 23.58 有效保留提交 运行 2 · 24.31 自然得分: 24.31 有效保留提交 · 获准替换 运行 3 · 24.53 自然得分: 24.53 有效保留提交 |
| 建立联动融资、运营与回报计算的收购模型。 | GPT-6 Astra | 25.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 31.85 有效保留提交 运行 2 · 25.00 自然得分: 42.71 有效保留提交 运行 3 · 25.00 自然得分: 42.55 有效保留提交 |
| 检索来源财务信息并关联至要求的收购模型输出。 | GPT-6 Astra | 22.70 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 25.37 有效保留提交 运行 2 · 19.44 自然得分: 19.44 有效保留提交 · 获准替换 运行 3 · 23.66 自然得分: 23.66 有效保留提交 |
03现金流GPT-5.6 Sol28.502/2 任务 · 4/6 次触发上限GPT-6 Astra27.222/2 任务 · 5/6 次触发上限
| 任务 | 模型 | 平均得分 | 触发上限 | 运行证据 |
|---|---|---|---|---|
| 将财务披露调节为公式驱动的现金流量表。 | GPT-5.6 Sol | 29.08 | 2/3 | 查看各次运行运行 1 · 25.00 自然得分: 37.14 有效保留提交 运行 2 · 25.00 自然得分: 37.84 有效保留提交 运行 3 · 37.23 自然得分: 37.23 有效保留提交 |
| 将交易假设转换为联动的现金流影响与财务检查。 | GPT-5.6 Sol | 27.91 | 2/3 | 查看各次运行运行 1 · 21.69 自然得分: 21.69 有效保留提交 运行 2 · 25.00 自然得分: 38.22 有效保留提交 运行 3 · 37.05 自然得分: 37.05 有效保留提交 |
| 将财务披露调节为公式驱动的现金流量表。 | GPT-6 Astra | 29.43 | 2/3 | 查看各次运行运行 1 · 25.00 自然得分: 37.86 有效保留提交 运行 2 · 38.30 自然得分: 38.30 有效保留提交 运行 3 · 25.00 自然得分: 35.76 有效保留提交 |
| 将交易假设转换为联动的现金流影响与财务检查。 | GPT-6 Astra | 25.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 34.59 有效保留提交 运行 2 · 25.00 自然得分: 34.35 有效保留提交 运行 3 · 25.00 自然得分: 34.59 有效保留提交 |
04贷款资产池GPT-5.6 Sol10.002/2 任务 · 6/6 次触发上限GPT-6 Astra62.502/2 任务 · 3/6 次触发上限
| 任务 | 模型 | 平均得分 | 触发上限 | 运行证据 |
|---|---|---|---|---|
| 应用贷款资格规则并核对形成的组合指标。 | GPT-5.6 Sol | 10.00 | 3/3 | 查看各次运行运行 1 · 10.00 自然得分: 31.90 有效保留提交 运行 2 · 10.00 自然得分: 34.43 有效保留提交 运行 3 · 10.00 自然得分: 34.43 有效保留提交 |
| 根据逐笔贷款资格及融资约束计算借款基数。 | GPT-5.6 Sol | 10.00 | 3/3 | 查看各次运行运行 1 · 10.00 自然得分: 17.14 有效保留提交 运行 2 · 10.00 自然得分: 25.00 有效保留提交 运行 3 · 10.00 自然得分: 24.29 有效保留提交 |
| 应用贷款资格规则并核对形成的组合指标。 | GPT-6 Astra | 100.00 | 0/3 | 查看各次运行运行 1 · 100.00 自然得分: 100.00 有效保留提交 运行 2 · 100.00 自然得分: 100.00 有效保留提交 运行 3 · 100.00 自然得分: 100.00 有效保留提交 |
| 根据逐笔贷款资格及融资约束计算借款基数。 | GPT-6 Astra | 25.00 | 3/3 | 查看各次运行运行 1 · 25.00 自然得分: 25.00 有效保留提交 运行 2 · 25.00 自然得分: 25.00 有效保留提交 运行 3 · 25.00 自然得分: 25.00 有效保留提交 |
05并购与融资GPT-5.6 Sol9.342/2 任务 · 1/6 次触发上限GPT-6 Astra41.002/2 任务 · 6/6 次触发上限
| 任务 | 模型 | 平均得分 | 触发上限 | 运行证据 |
|---|---|---|---|---|
| 通过联动的汇率、税务与现金流情景比较融资结构。 | GPT-5.6 Sol | 12.44 | 1/3 | 查看各次运行运行 1 · 5.42 自然得分: 5.42 有效保留提交 运行 2 · 6.91 自然得分: 6.91 有效保留提交 运行 3 · 25.00 自然得分: 33.12 有效保留提交 |
| 对不同融资路径及其汇率与税务影响进行建模。 | GPT-5.6 Sol | 6.23 | 0/3 | 查看各次运行运行 1 · 6.47 自然得分: 6.47 有效保留提交 运行 2 · 7.95 自然得分: 7.95 有效保留提交 运行 3 · 4.28 自然得分: 4.28 有效保留提交 |
| 通过联动的汇率、税务与现金流情景比较融资结构。 | GPT-6 Astra | 38.25 | 3/3 | 查看各次运行运行 1 · 34.49 自然得分: 34.49 有效保留提交 运行 2 · 38.64 自然得分: 38.64 有效保留提交 运行 3 · 41.63 自然得分: 41.63 有效保留提交 |
| 对不同融资路径及其汇率与税务影响进行建模。 | GPT-6 Astra | 43.74 | 3/3 | 查看各次运行运行 1 · 42.25 自然得分: 42.25 有效保留提交 运行 2 · 44.49 自然得分: 44.49 有效保留提交 运行 3 · 44.49 自然得分: 44.49 有效保留提交 |
06IRR 与可比分析GPT-5.6 Sol19.682/2 任务 · 6/6 次触发上限GPT-6 Astra38.852/2 任务 · 3/6 次触发上限
| 任务 | 模型 | 平均得分 | 触发上限 | 运行证据 |
|---|---|---|---|---|
| 在融资与流动性约束下比较项目现金流和回报。 | GPT-5.6 Sol | 21.31 | 3/3 | 查看各次运行运行 1 · 24.32 自然得分: 24.32 有效保留提交 运行 2 · 14.59 自然得分: 14.59 有效保留提交 运行 3 · 25.00 自然得分: 25.54 有效保留提交 |
| 根据所给输入及输出要求建立可审计的资本预算模型。 | GPT-5.6 Sol | 18.06 | 3/3 | 查看各次运行运行 1 · 20.68 自然得分: 20.68 有效保留提交 运行 2 · 25.00 自然得分: 31.62 有效保留提交 运行 3 · 8.51 自然得分: 8.51 有效保留提交 |
| 在融资与流动性约束下比较项目现金流和回报。 | GPT-6 Astra | 65.14 | 0/3 | 查看各次运行运行 1 · 64.73 自然得分: 64.73 有效保留提交 运行 2 · 64.73 自然得分: 64.73 有效保留提交 运行 3 · 65.95 自然得分: 65.95 有效保留提交 |
| 根据所给输入及输出要求建立可审计的资本预算模型。 | GPT-6 Astra | 12.57 | 3/3 | 查看各次运行运行 1 · 10.95 自然得分: 10.95 有效保留提交 运行 2 · 14.59 自然得分: 14.59 有效保留提交 运行 3 · 12.16 自然得分: 12.16 有效保留提交 · 获准替换 |
没有符合条件的任务。请清空搜索或重置筛选。
搜索只定位任务,不重新计算类别均值。排序描述选定样本,不代表公平的能力排名。
06 / 得分与约束
评分上限生效前后。
尚未评测。
查看全部类别数值
| 工作流 | 模型 | 自然得分 | 最终得分 |
|---|---|---|---|
| DCF 与经营模型 | GPT-5.6 Sol | 31.96 | 20.00 |
| DCF 与经营模型 | GPT-6 Astra | 51.76 | 46.59 |
| 杠杆收购 | GPT-5.6 Sol | 20.48 | 13.50 |
| 杠杆收购 | GPT-6 Astra | 28.75 | 24.21 |
| 现金流 | GPT-5.6 Sol | 34.86 | 28.50 |
| 现金流 | GPT-6 Astra | 35.91 | 27.22 |
| 贷款资产池 | GPT-5.6 Sol | 27.86 | 10.00 |
| 贷款资产池 | GPT-6 Astra | 62.50 | 62.50 |
| 并购与融资 | GPT-5.6 Sol | 10.69 | 9.34 |
| 并购与融资 | GPT-6 Astra | 41.00 | 41.00 |
| IRR 与可比分析 | GPT-5.6 Sol | 20.88 | 19.68 |
| IRR 与可比分析 | GPT-6 Astra | 38.85 | 38.85 |
自然得分是账本记录的封顶前得分,并非准确率,也可能已受其他评分规则影响。硬性上限只限制最终得分,不增加分数。 悬停或点击条形,查看任务与各次运行得分。
07 / 方法论
以证据为基础,让评分可验证。
金融任务、可执行工作流与可衡量的奖励,共同构成开箱即用的 RL 环境。自然得分反映完成质量;未满足关键要求时,硬性上限约束最终得分。执行记录与封存提交让结果可追溯、可复核。
先验证证据,再授予分数
Toneme · 评测方法论- 01任务与素材
- 02记录执行
- 03冻结提交
- 04评测自然得分获得的质量分数与硬性评分上限约束得分最终得分这是上限,而不是奖励。
- 05可审计结果
检查因题型而异;基础设施失败不计分。
完整 RL 环境,开箱即用。
我们配套交付任务环境、源文件、Docker 配置、执行约定与奖励评估组件。安装所需运行时及镜像后,研究人员可通过随附工作流运行 Agent、收集轨迹并评分。评估包提供环境与评分组件,本网站展示公开证据。
奖励质量,约束捷径。
自然得分记录任务获得的分数;关键要求未满足时,硬性上限限制得分。适用检查考察公式、重算及输入响应,减少仅凭看似合理的静态答案获得分数的空间。这些机制针对具体失败模式,不构成完全抵御奖励破解的证明。
控制运行条件,保留原始提交。
Docker 配置与记录的运行参数支持检查和回放。Type06 回放使用新容器、只读任务输入及独立输出目录,并核对执行前后的提交校验值。该题型的重算与公式缓存检查有助于识别工作簿中的过期数值。这些控制降低残留状态风险;回放仍依赖所需镜像和计算环境。
将证据与结果关联。
选定的 Astra 运行包含步骤与时间戳。提交校验值、评分回执与验收账本将保留结果与证据关联。在所记录的恢复配置下,基础设施失败不计分,不被转换成模型失败,也不用于重跑有效低分提交。
全页使用同一计算口径。
分数统一采用 0–100 刻度。先计算每道任务各次保留运行的均分,再对已覆盖任务等权平均;类别内沿用相同规则,并明确展示覆盖范围。比较模型前,应考虑任务数量与选择协议的差异。
通过限定范围的试点评估训练效果。
本样例展示不构成对训练增益或模型排名的统计结论。训练效果应针对目标模型与目标,通过限定范围的试点进行评估。
继续技术交流
讨论私有评估包。
对私有评估包或更广泛的任务集感兴趣?请通过邮件讨论你的模型、工作流与评估目标。
索取私有评估包