生活分享

用量与效率:减少重工

记录任务条件、模型选项、时间与成果,找出能减少无效重试和过多上下文的调整。

阅读时间约 15 分钟 · 操作 25 分钟

原创流程示意图,非产品界面截图。
图片:Mokaair (© Mokaair)
回总目录:Codex 学习中心:完整教程目录

进阶 · Desktop / mobile / CLI / VS Code / JetBrains / cloud

本篇目录
  1. 目标与准备
  2. 步骤 1:先确认自己量的是什么
  3. 步骤 2:固定比较条件与正确答案
  4. 步骤 3:只改提示词的具体程度
  5. 步骤 4:用同一把尺验收两个结果
  6. 步骤 5:把结果变成可持续的习惯
  7. 完成与常见误判

目标与准备

本段提到的教学与资源: 练习包 ·

步骤 1:先确认自己量的是什么

ChatGPT/Codex 的方案额度与 API 金额是不同指标。介面显示的可用比例可能是整个帐号共享视窗,会受其他任务、重置时间及方案影响;不能把前后差一个百分点当成这个任务的精确价格。API 的 token 与费用也要依当时模型、计价及实际 usage 纪录核对,不把 CLI 印出的所有 token 直接乘单一单价。本文把模型与价格连回集中维护的帐号/模型篇,不重复固定可能改变的数字。

指标记录方式不能直接推论的事
人的操作时间从准备提示词到核对结果不等于模型处理时间
回答等待时间开始至最后回答的时间不等于纯推理速度
重工次数补充条件、改正误解、重做的次数少回答不保证正确
验收通过项目对照事先定义的四项不能只凭语气判断
额度/usage抄下介面实际可见资讯帐号比例不等於单次费用

若无资料填 unavailable,若只是估计写 estimated,并说明方法;不要用 0 代替没有资讯。

步骤 2:固定比较条件与正确答案

两个资料夹都用相同 broken 原版,不在其中一份先修程式。各执行一次 node --test core.test.mjs,确认同样是原三项中两项通过、一项失败;这个测试只用 Node,不消耗模型额度。缺陷是 visibleTasks 在 completed 分支仍挑选 !task.completed。自己先记住这个基准,但不把正确修法直接写入待比较的提示词。A、B 都要提出修正计划,不实际修改或启动服务。

在同一入口、同一台主机各开一个新任务,A 指向 efficiency-a,B 指向 efficiency-b,使用同一模型与推理深度;若帐号没有某个选项,就记录目前预设,不猜型号。两次依序执行,避免同时使用造成等待互相影响。新任务能减少对话答案互相污染,但快取、网路、服务负载仍不完全相同,因此这是自己的流程练习,不是可发表的模型效能排名。

步骤 3:只改提示词的具体程度

A 是资讯较少但仍有目标的请求;B 加入可重现输入、预期/实际与档案范围。两者的最终目标相同,不同的是你提前提供多少可靠背景。记下各自撰写提示词花的时间,再送出一次。若代理追问,正常回答并计入补充次数;不为了让 B 胜出而拒绝提供 A 所需要的资讯。

A:较少背景的请求 · text
Find why Completed shows unfinished tasks in this project.
Explain the cause, propose the smallest fix and give verification steps.
Read only; do not edit files, run tests or start services.
B:提供重现与范围 · text
Investigate the Completed filter in this Small Steps practice copy.
Reproduction: add Read and Build, complete Read, then choose Completed.
Expected: only Read. Actual: only Build.
Inspect core.mjs, app.js and core.test.mjs as needed.
Explain the cause, propose the smallest fix while preserving Active/All behavior,
and give exact Node and browser verification steps.
Read only; do not edit files, run tests or start services.

步骤 4:用同一把尺验收两个结果

四项都要人工核对:是否定位 visibleTasks 的 completed 条件;是否建议只让 completed 分支保留 task.completed 为真的资料;是否保留 Active/All 行为;是否提出 node --test core.test.mjs 及同一个 Read/Build 画面重现。额外检查它没有声称已执行你禁止的测试,也没有修改档案。多写一页泛泛的风险清单不会加分,短答案若缺少验证也不算完成。

efficiency-notes.md(填入实际观察) · markdown
# Workflow comparison
Date / host / surface / CLI or app version:
Model and reasoning setting:
Fixture: unchanged broken copy

| Metric | A | B |
| --- | --- | --- |
| Prompt preparation time | | |
| Wait until final answer | | |
| Human verification time | | |
| Clarification/correction turns | | |
| Accepted criteria out of 4 | | |
| Actual visible usage, or unavailable | | |
| Files unchanged | | |
| Remaining uncertainty | | |

Decision and evidence:
One adjustment to try next:

步骤 5:把结果变成可持续的习惯

比较人的准备+验证时间、等待与重工,而非只看最快的回答。B 若让准备多花两分钟却省下多次追问,可能适合日常流程;若 A 也能一次完整通过,就没有证据说每个小任务都要写长文件。将有效的重现格式存到,保留目标、来源、范围与验收即可,不把整段聊天历史全部贴回每次任务。这能减少过期背景与相互矛盾的条件。

用一个明确虚构的算例练习判读:A 准备 1 分钟、等待 3 分钟、验证 4 分钟,四项只符合三项;B 准备 3 分钟、等待 4 分钟、验证 1 分钟,四项皆符合。两者已记录时间合计都是 8 分钟,B 的首次等待较长但交付较完整;A 的补救时间尚未量到,所以不能宣称两个完整工作同样快。这不是任何模型的效能数据。

判读时再问:四项是不是事先订好、品质是否真的核对、未提供用量是否留 unavailable。若两者都符合四项,才比较完整操作时间与重工。将上面的虚构数字和自己的观测表分开;下一轮沿用同一份评分条件,一次只调整一个因素,才有办法解释变化来源。

下一轮若要比较模型或推理深度,先固定已验收的 B 提示词与同一输入,再只改一项可用设定,依的方法记录。不要同时换模型、增加子代理、改提示词再把差异全部归因于速度。大量平行工作与长时间重试也会产生用量;对单一小问题先把目标缩小通常比增加工具更容易验证。需要长任务时用保存已验证状态,避免下一次重做全部探索。

完成与常见误判

两份副本应仍未改动,保存观察表及两次回答;若代理擅自修改,记录为范围失败,先保存差异再还原自己的副本。一次比较只能支持本次条件下的选择,不能推论某模型永久较省、某方案固定能做多少任务。额度画面没有更新、重置发生或其他任务同时使用时,该栏写不可比较。完成标准是四项品质判断有依据、时间有方法、未知用量没有假数字,并选定下一个最小调整;不是让统计看起来全部进步。

原创流程示意图,非产品界面截图。
原创流程示意图,非产品界面截图。 · 图片:Mokaair (© Mokaair)
阅读完整文字说明

Three numbered stages: identify the starting point, perform the exercise, and verify the result. Original illustration, not a product screenshot.

回总目录

  • 生活分享

    Codex 学习中心:完整教程目录

    从安装、第一个任务到 MD 规则与进阶集成,规划 60 篇 Codex 教程、十个单元。按程度、平台、需求或命令搜索下一篇;尚未公开的教程会标示状态,方便安排学习路线。

  • 生活分享

    Worktree 与多任务隔离

    Worktree 让同一个 Git 程式库有不同的工作目录,各自承接不同分支。它适合让两项工作分开改档,但资料库、连接埠与外部服务仍可能共用,不能把档案隔离当成所有资源隔离。

  • 生活分享

    实战:制作小网站

    从 brief.md 规划并制作 Small Steps 待办网站,完成新增、完成、删除、筛选与本机资料保存。将 HTML、CSS、资料函式、画面事件与测试分开,以 Node 测试和浏览器操作验收,并留下可重新启动与还原的交接纪录。

  • 生活分享

    先读懂一个既有专案

    用唯读流程找到启动点、资料流与测试,产生有档案依据的专案地图。

最新旅游情报攻略

资料来源

生活分享