-
Buzz:Block 给 AI Agent 发了一张身份证
过去几年团队协作工具一直在做加法,但有个设定从没变过:Agent 是"工具"。人用一把 bot token 把它塞进频道,它干了什么、改过哪个分支、谁授权过,事后只能去 CI 日志里慢慢翻。Buzz 直接把这个设定掀了。它给每个 Agent 发一对 Nostr 密钥,让 Agent 以独立成员的身份出现在频道里,人和 Agent 用同一套身份模型签名,留在同一条事件日志里。 我…- 1.2k
- 0
-
AI-agent-book :华为天才少年的生产级 Agent 工程笔记
李博杰把自己写这本书时跟 Cursor 的全部对话,原封不动放进了仓库一个叫 cursor-chats 的文件夹。从审标题、翻译官方文档,到删重复段落,几百条提示词躺在那里,谁都能翻。我刷了这么多年 GitHub,第一次见有人这么干。这个人不是全职写书的,他是 Pine AI 的首席科学家,日常产品是让 AI 打电话帮美国人跟运营商、银行掰扯账单、协商退款。 这样一个人的书,性质就变了。市面上讲 …- 1.1k
- 0
-
GLM-5.3 评测:不换基座,纯靠后训练硬拉出开源编程第一
同样是开源模型,有的靠堆参数,有的靠堆数据,智谱这次选了第三条路:基座一个字不动,只把后训练规模拉到极限。GLM-5.3 的编程能力比前代直接涨了一半,终端基准分数翻了数倍,还顺手把网络安全这个新赛道的开源榜首也拿了。权重两周后开源,现在多个编码平台已经能免费上手。 这到底是什么 GLM-5.3 是智谱 Z.ai 在 2026 年 8 月 14 日发布的新一代开源基座模型,总参数 7430 亿。它…- 993
- 0
-
Agent-identifier:用一套 Prompt 模板把 Agent 创建变成工程问题
在 Claude Code 里创建 Agent 这件事,看起来门槛很低。建一个 markdown 文件,写一段 system prompt,放到 agents 目录,完事。但真跑起来你会发现,Agent 不触发、触发了行为跑偏、或者 prompt 太长 Claude 直接忽略关键约束,这些问题出现的频率远比想象中高。 agent-identifier 是 Anthropic 在 Smithery.…- 1k
- 0
-
Polar AI 测评:一个不抢 Chrome 饭碗、却能每周替你省 25 小时的”数字同事”
每天打开几十个标签页只为了回答一个问题,填几百次同样的表单,周而复始地更新同一张表格,干这些活的人都知道这不是工作,是消耗。前 Perplexity Comet 工程师 Kevin Jiang 拉了 MIT 同窗单干,做了个叫 Polar 的 AI 浏览器,专治这种"不该人干却非得人干"的杂活。7 个月口碑传播跑出 450 万次网页操作,刚拿了 Madrona 领投的 570 …- 975
- 0
-
PyTorch PR Review:一个只报问题不夸人的代码审查员
给 PyTorch 提 PR 是什么体验?你花了两周写完一个算子优化,通过了所有 CI 检查,Lint 全绿,测试全过,然后等了两周没人 review。好不容易有人看了,留了一条评论:“LGTM”。 这不是段子,是 PyTorch 贡献者每天都在经历的现实。PyTorch 仓库有超过四千个贡献者,每天几十个 PR 涌入,而核心维护者的带宽是固定的。结果就是大量 PR 要么被粗放式 review 放…- 1.2k
- 0
-
Flintchart:一个给AI Agent用的”图表中间语言”,到底解决了什么真问题
你让AI Agent帮你画个图。它开始输出了,Vega-Lite的JSON,200行。语法没问题,但坐标轴起点是负的,配色扎眼,图例压在了数据点上。你让它改,它改了三版终于不报错了,但样子就是没法看。 这不是prompt写得不好。是图表库本身太啰嗦了。一个体面的热力图,ECharts要写50行配置,Vega-Lite要声明时间单位、轴格式、颜色域、单元格尺寸,任何一个参数填错,图就崩了。让LLM记…- 1.2k
- 0
-
Cloudflare Sandbox SDK:在 Worker 里起一个沙箱,跑完就销毁
AI Agent 变得越来越能干,但有一个问题越来越尖锐:它生成的代码,你敢不敢让它跑? 这是个真实的困境。Agent 帮你写了一段 Python 来清洗数据,代码逻辑看起来没问题,但你不确定 import 的那个包会不会悄悄读你的环境变量,不确定那段 shell 命令是不是真的无害。你当然可以自己先审查一遍再跑,但这样 Agent 帮你省的时间又被审代码吃回去了。 Sandbox SDK 就是冲…- 1.1k
- 0
-
ego-lite:一个让 Claude Code 和你的 Chrome 和平共处的浏览器
你见过 Agent 开浏览器吗。不是那种官网演示视频里的优雅截图,是真实的、在你自己的电脑上跑起来之后的样子:鼠标开始自己移动,标签页被切来切去,你正在看的那篇技术文档被 Agent 关掉了,换成了一个登录页面。你坐在屏幕前盯着光标飘,除了等它搞完,什么也做不了。 ego-lite 解决的就是这个每天在 Claude Code 和 Codex 用户电脑上反复上演的场景。它给自己的定位非常直接:一个…- 1.2k
- 0
-
Claude Opus 5 深度评测:半价追平 Fable 5,Anthropic 这波有多猛?
花了半年等 Fable 5 降价?Anthropic 直接甩出了更狠的一手。Opus 5 在编程、复杂推理和 Agent 任务上逼近 Fable 5 的表现,价格一刀砍半。更低成本、更高效率,还默认开启了思考模式,这次的 Opus 升级不是挤牙膏,是直接换赛道。 产品概述 Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日发布的新一代旗舰大模型,定位为日常高频使…- 912
- 0
-
daily-briefing :从信息收集到优先级排序的三步引擎
早上九点,你打开电脑。日历上塞了五个会,邮箱里躺着三十封未读,CRM 里有七个 deal 状态不明。你的本能反应是什么?多数人会先回最上面那封邮件,然后被会议推着走完一天,到下午六点才发现最重要的那件事还没动。 daily-briefing 要解决的就是这个问题。它是 Anthropic 在 Smithery 上发布的一个销售简报 Skill,核心逻辑很简单:每天早上花两分钟,把今天最重要的那件事…- 1k
- 0
-
Scvi-tools :一个 Skill 让单细胞分析从查文档变问答
你可能没听过 scvi-tools,但你一定见过这样的场景:生信团队为了跑一个批次校正,翻了三天文档、改了五版参数、最后发现卡在"输入格式不对"上。这种事情在单细胞组学领域太常见了,scvi-tools 本身就是为了解决这类问题而生的框架,但坦白说,用起来依然需要相当的前置知识。 这个 Smithery Skill 做的事情,本质上就是把 scvi-tools 的 8 个深度学…- 1k
- 0
-
Cloudflare Sandbox SDK:给你的 AI Agent 配一个不会炸的代码执行环境
你有没有遇到过这种情况,Agent 很聪明地帮你写了一段 Python,你看着代码逻辑没问题,但你不敢让它跑。不是不相信 AI,是不相信 AI 生成的代码不会在服务器上搞出点什么意外。 这就是 Sandbox SDK 要解决的核心矛盾。AI 需要执行代码来完成任务,但你不想给它 root 权限。Cloudflare 的方案是把"不受信任的代码执行"这件事做成了一个 SDK,让你…- 1.1k
- 0
-
Building-ai-agent-on-cloudflare:一站式代码生成器,从零到部署只要一条命令
大多数教你"在边缘部署 AI Agent"的文章,读完之后的感受是差不多的:概念都对,但代码得你自己写。Durable Objects 怎么配、WebSocket 路由怎么接、状态同步怎么处理,全是你的活。 Cloudflare 这个 building-ai-agent-on-cloudflare Skill 做的事情,就是把上面这些胶水代码替你写完。 它不是一个 AI Age…- 45
- 0
-
PyTorch 构建 building 深度拆解:从环境准备到跨端编译
如果你试过从源码构建 ExecuTorch,应该对那种"卡在环境配置就花了半小时"的感觉不陌生。每一步都可能踩坑: conda 环境死活激活不了 cmake 版本不对,报错信息还看不出原因 submodule 没同步完整,第三方依赖的 CMakeLists.txt 找不到 交叉编译参数漏了一个,链接时符号全丢了 官方文档写得再详细,实际操作时总会有一些路径问题、权限错误、版本冲…- 974
- 0
-
Copilot SDK:不用自己写 Agent 编排层是什么体验
写代码的时候按 Tab 补全,这是大多数人对 GitHub Copilot 的全部印象。一个嵌在 IDE 里的自动补全工具,好用,但也仅限于此。很多人可能从来没想过,这套补全背后的 Agent 引擎能不能单独拿出来用。 但 GitHub 最近放出了一个技术预览版的东西,完全改变了这个认知。Copilot SDK,一个允许开发者在任何应用程序中编程调用 Copilot Agent 引擎的开发包,四个…- 1k
- 0
-
Claude Sonnet 5 评测:Agent 能力下放到中端,但真值这个价吗?
让 AI 自己规划任务、调用工具、跑终端,几个月前还只是 Opus 旗舰用户的特权。Anthropic 刚发布的 Claude Sonnet 5 把这种 Agent 能力压到了不到一半的价格,编码跑分直逼旗舰。但新分词器偷偷让 Token 消耗涨了三成,Max 模式跑同样的活反而更贵。第一批用户已经吵翻了天。 产品概述 Claude Sonnet 5(代号 Fennec)是 Anthropic 在…- 896
- 0
-
豆包2.1 Pro 实测:国产大模型杀进”生产级”,编程和Agent这次是真的能打了
让一个大模型连续干18个小时不掉链子,是什么体验?豆包2.1 Pro 给出的答案是跑完整套芯片RTL设计流程,多轮迭代一气呵成。这次火山引擎不再只谈对话,而是把代码交付和长程Agent摆上台面,直接对标国际顶尖旗舰,API价格还压到行业最低梯队。它是参数堆出来的纸面强,还是真能扛生产?上手扒了一遍才有底气说。 产品概述 豆包2.1 Pro(Doubao-Seed-2.1 Pro)是字节跳动旗下火山…- 1.1k
- 0
-
OpenHuman:当个人 AI 助手开始说”我了解你”
如果你关注过个人 AI Agent 这个赛道,大概率听过两个名字:OpenClaw 和 Hermes Agent。OpenClaw 做的是"让 AI 常驻你的电脑",Hermes Agent 做的是"让 AI 从经验中学习技能"。它们都在抢"个人 AI 助手"这个坑位。OpenHuman 走的是第三条路:它让你把邮箱、日历、GitHub、…- 1k
- 0
-
Playwright MCP 上手实录:让 AI 帮你操控浏览器的正确姿势
说一个你可能也遇到过的场景。你让 AI 帮你查一个网站上的信息,AI 说它不能访问网页。你让它帮你填一个在线表单,它告诉你它没有浏览器。你让它帮你截一张网页的图,它回你一段文字描述。这事搁在 2025 年之前算正常,但放到现在,已经不应该了。 MCP 协议的出现让这件事开始松动。以前 AI 只能通过 API 跟外部世界交互,就像一个只会打电话的人。但 MCP 给它装上了手脚,让它能操作数据库、读写…- 1k
- 0
-
CLI-Anything:让 AI Agent 操控一切软件,港大这个项目是认真的吗?
我在 GitHub 上泡了五年多,看到这个数字的第一反应是警惕:又一个靠"Agent"概念冲上热榜的项目。今年上半年带 Agent 标签的新仓库,十个里有八个是套壳 Demo,README 写得天花乱坠,跑起来第三条命令就报错。 但 CLI-Anything 不太一样。它做的事情既激进又务实:**直接把 Blender、GIMP、OBS Studio 这些图形软件,一键转成 A…- 921
- 0
-
Claude Fable 5 评测:Anthropic 把神话级模型推向大众,但门票变贵了
代码库大到一个团队要干两个月,它一天跑完。这不是科幻,是 Claude Fable 5 在 Stripe 5000 万行 Ruby 代码上的真实战绩。Anthropic 把原本只给少数机构的 Mythos 级能力公开了,代价是价格翻倍、6 月 23 日后从订阅里踢出去单独收费。它到底强在哪,普通人用不用得起,上手试完这篇给你盘清楚。 这到底是什么 Claude Fable 5 是 Anthropi…- 2k
- 0
-
Agent Browser:把浏览器变成 AI 的确定性操作界面
让 AI 自己操作浏览器,这事听起来很酷。但真正做过的人都知道,坑比想象中多得多。CSS 选择器在动态页面里一碰就碎,等页面加载的时间比执行任务本身还长,一个登录状态丢了就得从头再来。 Agent Browser 是 Vercel Labs 专为 AI Agent 设计的无头浏览器 CLI 工具,在 ClawHub 上以 Skill 形式发布,方便集成进 OpenClaw 工作流。它的核心思路很直…- 117
- 0
-
AI 总是犯同样的错?这个 Skill,让我重新理解了什么叫”学习”
你有没有遇到过这种情况。跟 AI 说了一个小时的偏好,换个窗口,它全忘了。纠正了它三次同一个错误,第四次它还会犯。这不是 AI 笨,是你和它之间缺了一样东西:记忆。 直到我试了 self-improving-agent,才发现问题比我以为的更根本。大多数人跟 AI 共事的模式,本质上是在做一个"永不毕业的新员工培训"。你说了一遍又一遍,它从不做笔记。这件事的荒谬之处,我自己竟然…- 78
- 0
































