<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI for Science on 存昕的网站</title><link>https://opthuang.github.io/zh-cn/tags/ai-for-science/</link><description>Recent content in AI for Science on 存昕的网站</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://opthuang.github.io/zh-cn/tags/ai-for-science/index.xml" rel="self" type="application/rss+xml"/><item><title>Terminal-Bench Science：v0.1 收录的四个任务</title><link>https://opthuang.github.io/zh-cn/posts/terminal-bench-science/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://opthuang.github.io/zh-cn/posts/terminal-bench-science/</guid><description> 项目: Terminal-Bench Science, 一个面向自然科学计算任务的 AI 智能体基准。
版本: v0.1.0，2026 年 8 月发布。
参与工作: 我是 Terminal-Bench Science v0.1 的主要贡献者之一，我参与的四个任务已被 v0.1 收录。
概述 链接到标题 Terminal-Bench Science 关注 AI 系统能否在终端环境中完成较为真实的科学计算工作流。评测的不只是代码是否看起来合理，也包括智能体能否理解科学问题、完成计算流程，并给出可以检查的结果。
v0.1 中的四个任务 链接到标题 我参与的四个任务覆盖数学优化和机械工程工作流。每个标题都直接链接到 v0.1 标签下对应的 task 文件夹:
Noisy Black-Box Optimization：在函数评估次数有限且带有噪声的情况下进行优化。 Guided-Wave Damage Localization：利用导波测量信息定位结构损伤。 Baseline-Free Guided-Wave Damage Localization：在没有完好参考测量的情况下处理类似的定位问题。 Virtual-Baseline Crack Localization：在裂纹定位流程中使用由仿真提供参考的信息。 我与合作者参与了科学问题表述、任务实现和评测设置。这里暂时只保留概括性的介绍，公开版本的具体内容可以在项目仓库中查看。
为什么重要 链接到标题 AI for Science 需要尽可能贴近科学工作实际过程的评测。一个有用的 benchmark 应该覆盖从理解问题到得到有意义、可检查结果的完整路径，同时也要足够清晰，便于研究者复现和改进。
v0.1 是朝这个方向迈出的第一步。很高兴能在科学计算、优化和 AI 智能体评测的交叉处贡献四个任务示例。
公开链接 链接到标题 Terminal-Bench Science 项目仓库 v0.1.0 版本发布页</description></item></channel></rss>