邀请码不再限制你连接自己的账号。自带账号的能力对所有人免费开放,云端 Pro 仍为邀请制。阅读公告
公告2026 年 8 月 9 日

致每一位关注和使用 Mirasim 的朋友:

过去几天,仍处于内测、尚未做好大规模开放准备的 Mirasim,比原计划更早地来到了大家面前。

邀请码的传播范围超出了原定规模。短时间内,大量访问和测试请求涌入,同时也出现了部分异常高频的探测与访问请求。由于我们的容量、稳定性和安全防护准备不足,部分用户遇到了加载缓慢、请求失败、权益未到账等问题。

给大家带来的不好体验,我们诚恳道歉。无论流量因何而来,没有提前做好准备,都是我们的问题,不应该让用户承担后果。

与此同时,我们也收到了大量真实、具体的反馈。许多原本可能要在正式开放后才会暴露的问题,被大家提前发现了。感谢每一位认真体验、耐心反馈和负责任地报告安全问题的朋友。

接下来,Mirasim 将调整开放方式

邀请码不再限制你连接自己的账号使用 Mirasim;它只限制由 Mirasim 承担成本的云端 Pro 服务。

本地账号接入与调用能力将免费向所有用户开放。无需邀请码,你也可以连接自有的 Claude Code、Codex 等账号或模型服务,使用 Mirasim 的多模型、多 Agent 和多 Session 能力。Mirasim 不会对这部分能力收费;第三方订阅或 API 费用仍按对应服务商规则结算。

由 Mirasim 承担调用成本、帮助用户降低使用成本的云端 Pro 能力,将继续采用邀请制,并根据服务容量分批开放。我们会及时公布开放进度和后续安排,让规则尽可能清晰、透明。

关于大家关心的 Pro 权益

  • 原计划承诺的 1000 位内测用户,将获得 1 年 Mirasim Pro 权益,这一承诺不会改变。
  • 对于本轮超出原定 1000 人名额、但已经成功注册的用户,我们也将提供 1 个月 Mirasim Pro 权益,作为本次体验不稳定带来的补偿,也感谢大家愿意在产品尚未成熟时前来尝试。
  • 如果你已经完成注册或激活,但权益暂未到账,请不要重复操作。相关记录已经保存,我们会统一核验和补发,并同步后续到账与起算安排。

Mirasim 后续的开放节奏

未来 1—2 周,我们会集中扩充服务容量、修复权益系统、加强安全防护,并逐项处理大家反馈的问题。Mirasim 没有关闭,注册和本地账号能力会持续开放,云端 Pro 能力则会随容量分批开启。

我们希望构建的,不只是一个聚合模型的工具,而是一个面向长期创造的 Agent 工作空间。无论下一代更强的 Agent 出现在哪里,用户都能在同一个工作流中持续接入、无缝切换并协同使用;完成构建后,再交给仿真用户在真实环境中验证,让证据决定下一步。

我们想让每一次 Agent 能力的进步,都更快成为每个人的生产力,让大家少花时间追逐工具,把更多时间留给真正想做的事情。

模型会更替,创造无需重来。

谢谢大家在 Mirasim 还不够成熟的时候提前来到这里。接下来,我们会把承诺落实在每一次修复与更新中,用一个更稳定、更可靠的 Mirasim,回应大家的关注与信任。

—— Mirasim 团队

Mirasim 文档

第 14 章

用 $eval 做评测

让仿真用户在真实产品上完整使用一遍,保留轨迹作为证据,并据此决定下一步做什么。

为什么要用仿真用户

一个产品做出来之后,早期最需要了解的问题其实都比较粗:哪一步没人能走完、哪句话没人看懂、哪个按钮没人找到。这些问题在一次仿真运行中就会暴露,用时以分钟计而不是以周计,而且是在投入尚未沉没之前。

Mirasim 中的评测是一项需要显式调用的能力,不是常开的自动审查。需要证据时调用 `$eval`,仿真在本机运行。

一次运行的证据保存位置
产物面板列出各工作区的运行产出内容,可在生成它的会话旁边预览。

产物截图、轨迹、命令和报告都保存在这里,并绑定到产出它们的那一端。无法追溯到具体某次运行的结论,一律视为没有结论。(该控件不在当前这一屏上)

这块面板上的按钮可以直接点,点着看看。

执行一次评测

这套流程对「什么算有效信号」有明确要求,而且步骤顺序有讲究。

  1. 锁定版本,明确本次要决定什么

    锁定被测的具体版本,并写明不同结果会让你做出什么不同的选择。一次不会改变任何决定的评测,只是一份无人阅读的报告。

  2. 构建相互独立的画像与自然的场景

    与挑选真实测试用户的方式一致:缺乏耐心的新用户、跳过引导的熟手、正在寻找理由离开的怀疑者。每人带一件他确实可能会做的事,而不是一份需要照着走的脚本。

  3. 给每个用户真实的入口

    一份干净的上下文,加上真实的产品:一个浏览器、一台手机、一个命令行、一次对话,或者一份已渲染的产物。证据是运行时的操作与观察结果;阅读源码不计入用户证据。

  4. 先阅读证据,再做决定

    截图、命令、轨迹和产物都会保留,观察到的事实与推断出的判断分开记录。之后再决定:保留该改动、回退,或者换一批预留用例重新验证。

阅读结果

阅读一次运行的结果有推荐顺序,从最有用的部分开始。

  • 用户实际卡在哪里:也就是这次运行中断的那个操作或观察点。轨迹已保留,可以完整回看一遍。
  • 哪些是观察到的,哪些是推断出的:两者有意分开记录,前者可以直接采信,后者可以讨论。
  • 下一步该做什么:每一个观察到的问题都直接转化为下一轮循环中的一项开发任务。

跑过的记录留在应用里:按 ⌘K 搜「Eval 记录」就能打开已记录的模拟运行列表,上周那一轮搜一下就能找到,不必记住它存在哪个目录。

这一页有错或缺了什么? 告诉我们