跳至内容

OpenAI

OpenAI 的 Astra for Law 是法律 AI 系统,而非新模型

Astra for Law 是 OpenAI 面向法律研究的 GPT-6 Astra 配置,结合了检索、工具、治理与工作流集成。

Abstract legal research workspace with documents, search nodes and governance controls.
本页内容

法律 AI 的发布常常被包装成新模型。但这一次更准确地说,根据 SiliconANGLE 的报道,OpenAI Group PBC 于 2026 年 9 月 17 日推出的 Astra for Law,是 GPT-6 Astra 面向法律研究和起草的配置,而不是一个独立的基础模型。

这个区别很重要。报道指出,Astra for Law 在 GPT-6 Astra 外层加入了法律搜索索引和法律分析指令,然后将这一整套能力提供给律所和法律软件供应商。换句话说,这款产品的赌注不只是“更强的模型”,而是“更强的模型,加上围绕它的正确语料、工具界面、治理姿态和工作流集成”。

据 SiliconANGLE 报道,Astra for Law 通过 ChatGPT 和 Codex 中的 Trusted Access 计划向部分律所开放,并在模型选择器中显示为 GPT-6 Astra Law。名为 gpt-6-astra-law 的 API 版本也在计划中,但报道称 OpenAI 尚未给出该 API 发布的日期或定价。

法律索引覆盖范围很广。SiliconANGLE 报道称,它覆盖美国判例法、成文法、法规、法院规则和行政裁决,范围超过 2.3 亿个 URL,并且每天都会新增来源。非营利组织 Free Law Project 的 CourtListener 数据库提供了判例法数据。

此次发布还包括一个合作伙伴生态。据报道,26 个由合作伙伴构建的插件随模型一同上线,将 ChatGPT 连接到 Relativity、Clio、iManage 和 DeepJudge 等法律工具。Thomson Reuters 正在把 HighQ 的事项上下文引入 ChatGPT,并预览一个面向 CoCounsel Legal 的连接器。另外 9 个插件来自供应商体系之外的律师和法律工程师,包含 47 项自定义技能。

据报道,ChatGPT for Word 也在同一天正式全面可用。这个细节容易被忽略,但很重要:法律工作仍然发生在文档里。如果研究、起草、修订和事项上下文都能汇入律师已经在使用的工具中,采用问题就不再只是模型质量问题,而会变成工作流问题。

SiliconANGLE 描述称,OpenAI 选择的基准测试奖励的是找到正确的法律依据,以及其中正确的段落。Astra for Law 在 Vals AI 的 Legal Research Bench 私有验证集中抽取的 200 个问题上,通过了 54% 的整体正确性检查。仅使用网络搜索的 GPT-6 Astra 在相同问题上达到 38.7%,两个系统都以最高推理强度运行。

在判例法问题上,Astra for Law 找到的参考案例多出 24%。在另一组经过审计的数据集上,它从正确判决意见中检索到的目标段落最多多出 54%。

这些数字支持一种更窄的解读:检索质量和面向法律的特定封装提升了被测试任务的表现。它们并不能证明该系统已经可以取代法律研究判断,也不能证明它在基准之外同样有效,或每个答案都能在未经审查的情况下安全使用。

这不是批评。这是阅读法律 AI 基准测试的正常方式。法律研究容错率极低,因为“差不多正确”仍然可能是错误的。系统可能找到一个相关案例,却漏掉具有控制力的权威依据。它可能识别出正确的判决意见,却引用了错误段落。它可能陈述了一条后来被限缩的规则。相比通用网络搜索测试,同时考察权威依据和段落检索的基准更接近真实任务,但生产环境使用仍然取决于审查、引文核验和律所自身标准。

对构建者来说,这个经验与 RAG 系统中熟悉的教训一致:模型只是系统的一部分。检索层、语料质量、排序、引文和评估集,往往决定最终答案是否可信。构建自有法律、政策或合规助手的团队,在争论哪个模型最好之前,应该先建立一个领域专属的黄金数据集。我们的 RAG 分块与引文 指南介绍了法律领域之外同样的生产模式。

此次发布不只是搜索。SiliconANGLE 报道称,对于符合条件的律所,该产品在 API 上提供零数据保留,并且 ChatGPT Enterprise 的使用默认不纳入人工审查。Latham & Watkins 正在与 OpenAI 合作,围绕信息权限、伦理墙和客户指令设计治理机制。

这些细节不是装饰。律所对谁能查看哪个事项、适用哪些客户指令,以及两个团队是否应该彼此隔离,异常敏感。一个忽视伦理墙的法律 AI 系统不只是使用不便。它可能带来职业风险和保密问题。

这正是通用 AI 工具在企业内部经常失败的地方。它们在演示中或许能足够好地总结、起草和搜索,但并不会天然理解律所权限、事项边界、审批规则或保留政策。这些控制必须被设计进模型外围的执行框架中。

Thomson Reuters 首席技术官 Joel Hron 在 SiliconANGLE 报道中清楚地表达了这一点:“随着 AI 变得更加开放和可互操作,价值并不只在于连接本身。法律专业人士需要的不只是获取信息。他们需要可信的智能、相关的企业与事项上下文、专为法律打造的能力,以及高风险工作所需的治理。”

这句话也适用于法律之外的领域。医疗、金融、保险、采购和公共部门团队都面临形态相同的基本问题:私有上下文、受监管决策、工具访问、可审计性和人的责任。法律市场可能只是更早把这些要求推到台前。

如果你正在高风险场景中设计 AI 工作流,请把治理视为功能,而不是事后补救。会更改记录、发送消息、提交文件或暴露客户数据的工具调用,都应该经过明确的审查路径。像 AI 操作审批 这样的人在环系统,不只是安全护栏;它们是组织在不授予 AI 不受限制权限的前提下,仍能让 AI 保持有用的方式。

“不是新模型”这个细节为何重要

链接到此部分:“不是新模型”这个细节为何重要

Astra for Law 是 GPT-6 Astra 的一种配置,这是该公告中对 AI 构建者最有用的部分。它指向了企业 AI 似乎正在走向的方向:不是为每个行业准备一个单体模型,而是将可复用的前沿模型与领域语料、指令、工具、权限和评估打包在一起。

这种架构比为每个职业训练一个新模型更实际。法律工作需要判例法和事项上下文。客户支持需要工单、政策和 CRM 操作。工程代理需要代码仓库、问题跟踪器和部署工具。财务团队需要分类账、审批和审计轨迹。基础模型提供语言、推理和工具使用能力;外围系统提供领域能力。

这也是模型路由和编排重要的原因。工作流中的不同步骤可能需要不同能力:法律分析需要深度推理,引文查找需要快速检索,草拟条款表需要结构化输出,格式整理可能需要更安全、受约束的模型。能够在多个 AI 模型之间选择的平台,比单模型技术栈更容易适配,尤其当成本、延迟和可靠性会因任务而异时。

同样的模式也适用于工具。能回答问题的模型很有用。能从有权限控制的知识库检索、调用文档系统、打开事项上下文并生成修订稿的模型,则是一个工作流。构建者可以用 API 连接器、知识库和代理框架来近似这种结构,但他们需要把每个连接都作为产品的一部分来测试,而不是当作演示附加项。

SiliconANGLE 报道称,OpenAI 工程师嵌入个别律所后,也一直在 ChatGPT Enterprise 上构建律所专属工具。Sullivan & Cromwell 有一个协议分析器,可以在审查新交易时拉取谈判手册和选定先例,然后把发现转化为建议修订。Ropes & Gray 专注于交易尽职调查。Cooley 的 GO Public 处理首次公开募股准备工作,包括起草申报文件。

这些例子比“面向律师的 AI”更具体。它们显示了近期价值可能所在:可重复、文档密集、依赖先例的工作,并且律所已经有相应流程和内部示例库。

协议分析器可以被限定范围。它可以把草稿与操作手册对比。它可以引用先例。它可以提出修订建议,供律师接受、拒绝或修改。尽职调查工作流可以被拆解为清单、文档审查、问题提取和摘要。IPO 准备有已知产物,并且高度依赖文档。

这并不意味着工作容易。它意味着工作可以被定义。AI 系统在拥有边界、源材料、验收标准和审查步骤的工作流中表现更好。笼统的“做法律工作”代理,比按照已知操作手册起草的窄范围系统更难被信任。

对法律之外的团队来说,这是更好的模板。不要从尽可能宽泛的助手开始。先从一个输入明确、输出明确,并且有审查者能判断工作质量的工作流开始。如果任务跨越多个角色或工具,一个经过设计的多代理系统可能会有所帮助,但前提是工作流本身已经被理解。

法律团队和 AI 构建者现在应该做什么

链接到此部分:法律团队和 AI 构建者现在应该做什么

对于能够访问 Astra for Law 的律所,第一个问题不是基准测试是否令人印象深刻。第一个问题是,系统可以在哪里安全地对照现有工作进行测试。好的候选场景包括研究备忘录、第一轮权威依据收集、先例比较、尽职调查摘要,以及依据内部操作手册进行草稿审查。不合适的候选场景包括无人监督的最终建议、未经审查的提交决策,或任何无法核验权威来源的工作流。

团队应该围绕自己的事项构建评估。公开或私有基准可以展示一般能力,但律所需要知道系统是否能在自己的业务领域、偏好权威来源、文档惯例和风险容忍度下表现良好。不仅要跟踪答案正确性,还要跟踪引文质量、遗漏权威依据、错误自信、节省时间、审查者修改和升级处理率。

对法律 AI 供应商来说,这次发布提高了门槛。如果平台提供商能够提供法律索引、企业控制、插件和 API 访问,那么围绕聊天模型做一层轻量封装将更难自证价值。供应商需要在专有工作流深度、事项上下文、集成、UX、治理和客户信任上取胜。

对其他所有使用 AI 构建产品的人来说,Astra for Law 是一个关于封装的案例研究。护城河不只是一个 prompt。它是模型、检索、权限、工具、评估,以及工作本来发生之处的组合。

据 SiliconANGLE 报道,OpenAI 将此次发布描述为对法律领域长期投资的开始。最安全的解读也最有用:领域 AI 正在从“向通用聊天机器人提出更难的问题”,转向构建知道去哪里找、允许触碰什么、何时请求审批,以及如何把可验证工作交给审查者的系统。

如需更多 AI 新闻和实用指南,请订阅 LIA newsletter

  • Astra for Law 被描述为面向法律研究和起草的 GPT-6 Astra 配置,而不是独立的基础模型。
  • 报道中的基准提升指向了法律专属检索、语料质量和以引文为中心的评估的价值。
  • 治理是产品的核心,因为法律 AI 必须尊重事项权限、伦理墙、保留政策和审查路径。
  • 此次发布暗示了更广泛的企业模式:将前沿模型与领域数据、工具、权限和评估打包在一起。
  • 最清晰的用例是有边界、文档密集的工作流,例如研究备忘录、先例比较、尽职调查摘要和草稿审查。

据报道,Astra for Law 是 OpenAI 的 GPT-6 Astra 模型面向法律研究和起草的配置。它在基础模型周围加入了法律搜索索引、法律分析指令和集成。

不是。文章将其描述为 GPT-6 Astra 的一种配置,而不是独立的基础模型,这也是外围检索、工具和治理如此重要的原因。

Astra for Law 在法律基准测试中的表现如何?

链接到此部分:Astra for Law 在法律基准测试中的表现如何?

据报道,Astra for Law 在 200 个 Legal Research Bench 问题上通过了 54% 的整体正确性检查,而仅使用网络搜索的 GPT-6 Astra 为 38.7%。

法律 AI 系统可能接触机密事项、客户指令和带权限的文档。如果没有伦理墙、保留政策和审查步骤等控制,它们可能带来职业风险和保密问题。

法律行业之外的团队应该从 Astra for Law 学到什么?

链接到此部分:法律行业之外的团队应该从 Astra for Law 学到什么?

有用的模式是:将强大的模型与领域专属数据、工具、权限、评估和人工审查打包在一起,然后应用到输入和输出清晰的有边界工作流中。


作者

David Vicente Campos

NeuraLIA Labs 创始人、MyRealFood 联合创始人

我是莱昂大学毕业的计算机工程师。我共同创立了 MyRealFood,并在那里作为 CTO 打造了一款数百万人用来吃得更健康的应用;我还创立了 NeuraLIA Labs,在这里我打造 AI 产品。我在本站写下一路走来所必须理解的内容,就像我希望当初有人向我讲解的那样。

了解作者更多信息

由 NeuraLIA Labs 发布。

新文章直达你的收件箱

AI 新闻、指南和产品更新——有值得你花时间阅读的内容时,我们会发一封简短邮件。

更喜欢用消息接收?同样的内容,也在这里:WhatsApp 社群 (在新标签页打开)Telegram 频道 (在新标签页打开)
Abstract fluid vortex with geometric proof structures and a glowing verification grid.
openai9 分钟阅读

OpenAI 的 Navier–Stokes 证明主张,一文读懂

OpenAI 称,AI agent 找到了一个 Navier–Stokes 奇点,并用 Lean 形式化了证明。更难的故事在后面:审查、署名,以及私有 agent 集群在数学中的力量。

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering12 分钟阅读

Context engineering for long-horizon AI agents

Long-running agents do not fail only because the window is small. They fail when files, tool outputs and stale history crowd out the task the agent was supposed to finish.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev10 分钟阅读

Jev AI 模型为决策而生,而非写作

TypeSafe AI 的 Jev 正受到关注,因为它把软件智能视为一个概率问题:选择正确分支,附上置信度,并避免在代码只需要决策时还花钱让 LLM 写文本。

准备好让 LIA 替你选模型了吗?

所有 AI 模型都在一处——今天就免费开始。