🤖 AI工具与Skill周报
每周精选 · 落地价值分析 · 命令行级步骤
AI工具推荐周报 · 2026-08-02:视频模型开权重,建站权回本地
本期 AI工具推荐 覆盖 2026 年 7 月 30 日至 8 月 2 日三日内的新品与新版本,共 8 个工具 + 1 条生态动态。这三天的主线很清楚:视频生成模型第一次准备开放权重,建站与 CMS 从 SaaS 撤回自托管,Agent 记忆开始有「团队级」方案。具体而言,如果你做小红书园艺 / 她的自然花园 账号、写小说、做数据可视化,或者在维护自动化流水线,本期至少有 4 个工具能当天接进流程。
一、本周新工具(8 个)· AI工具推荐清单
1. MiniMax H3 —— 15 秒 2K 带原生双声道,国产视频模型首次开权重
全模态生成视频+音频即将开源0.8 元/秒
一句话定义:统一理解文本 / 图像 / 视频 / 音频四种上下文的通用生成模型,最高输出 15 秒 2K(2560×1440)24 FPS 视频,人声、音效、音乐联合生成,音频默认原生双声道。
适用场景:园艺账号的短视频物料。以前你要「先剪画面、再配音乐、再对口型」,H3 能一次给出带声音的成片。它最强的地方不是画质,而是用一句自然语言描述多素材之间的关系——例如「参考视频 1 的希区柯克式镜头运动,让图 2 里的人物唱歌,歌声用音频 3」,模型自己完成跨模态拆解。值得注意的是,H3 在 Artificial Analysis 榜单的视频编辑能力项排名全球第一,文生视频有声榜 Elo 1242 排第二(第一是 Gemini Omni Flash 1245,只差 3 分)。
落地步骤:
# 1) 先在海螺 AI / MiniMax 开放平台跑通单条
# 默认 2K 输出 0.8 元/秒,约为同级旗舰模型的 1/3;768P 档不到主流 720P 的 1/2
# 2) 批量调用(官方称「未来几天内」开放权重,届时可本地部署)
export MINIMAX_API_KEY="你的key"
curl -X POST https://api.minimax.io/v1/video_generation \
-H "Authorization: Bearer $MINIMAX_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"H3","resolution":"2K","duration":10,
"prompt":"清晨花园,露水沿绣球花瓣滑落,镜头缓慢推近,背景鸟鸣与风声"}'
# 3) 接进周更流水线:把选题表里的 prompt 列批量喂进去
# 15 秒成片 × 0.8 元/秒 ≈ 12 元/条
2. CoreBunch/Instatic —— 开源版 Webflow / Framer / WordPress,输出纯静态页
自托管 CMS静态输出AgenticCRDT 实时协作
一句话定义:自托管的 agentic 可视化 CMS,带用户 / 角色 / 插件 / 内容 / 数据库全套后台,发布产物是干净的静态页面。
适用场景:同时维护博客和品牌站的人,最烦的是两个坑:「WordPress 慢 + 插件打架」和「Webflow 每月订阅、内容锁在别人服务器上」。Instatic 走第三条路——可视化编辑体验对齐 Framer,产出却是静态 HTML,可以直接扔 Cloudflare Pages 或对象存储。另外,它的实时协作基于 Yjs CRDT,多管理员同时改一个页面有实时光标、选区、头像堆叠和冲突检测,这在自托管 CMS 里很少见。插件系统区分沙箱 / 非沙箱,editor.code 被单列为危险权限。
落地步骤:
# 依赖 Bun 工具链 curl -fsSL https://bun.sh/install | bash git clone https://github.com/CoreBunch/Instatic.git cd Instatic bun install bun run dev # 本地起 CMS,注意 Vite 与 CMS 端口的代理配置 # 生产构建 → 产出静态页 bun run build # 部署(以 Cloudflare Pages 为例) npx wrangler pages deploy ./dist --project-name my-site
3. Capptivo —— 免费开源的录屏 + 产品演示编辑器
录屏Demo 编辑开源免费
一句话定义:免费开源的屏幕录制与演示视频编辑器,录完直接做自动缩放、高亮、光标动效等 demo 化处理。
适用场景:做 AI 工具教程、Skill 使用演示、自动化流水线复盘时,Screen Studio 那类工具一次性授权要 200 美元起。Capptivo 把「自动跟随光标缩放 + 平滑运镜 + 背景圆角」这几个最值钱的能力做成了开源免费版。与此同时,它对竖屏输出也友好,录一次可以裁两个比例,横版进长视频平台、竖版进小红书。
落地步骤:
# 方式一:官网 / GitHub Releases 下载安装包(macOS) # 方式二:源码构建 git clone https://github.com/capptivo/capptivo.git cd capptivo && npm install && npm run tauri:build # 典型工作流 # 1) 录制 → 2) 打开自动光标缩放 → 3) 导出 16:9 与 9:16 两版 # 4) 9:16 版进小红书 / 视频号;16:9 版进 YouTube
4. DeepSeek-V4-Flash-0731 —— Flash 价位的前沿 Agent 智能
Agent 模型Responses APICodex CLI
一句话定义:V4-Flash 的正式版,agentic 能力大幅提升,官方称在关键基准上超过 V4-Pro(Preview),原生支持 Responses API 并完成 Codex CLI 适配。
适用场景:自动化流水线里有大量「不需要顶配智力、但调用量很大」的环节——扫 RSS、给素材打标签、把评论区归类、给六顶思考帽 Bot 的每一顶帽子生成初稿。因此这类任务用 Pro 档模型纯属浪费。Flash 档正式版补上 agentic 短板后,可以把这些环节整体降档。换句话说,同一条流水线把 70% 的调用切到 Flash,月度 token 账单通常能砍掉一半以上。
落地步骤:
# 1) Codex CLI 直接切换
export OPENAI_BASE_URL="https://api.deepseek.com/v1"
export OPENAI_API_KEY="你的deepseek key"
codex --model deepseek-v4-flash-0731
# 2) Python 侧(Responses API 原生支持)
pip install openai
python - <<'EOF'
from openai import OpenAI
c = OpenAI(base_url="https://api.deepseek.com/v1", api_key="你的key")
r = c.responses.create(model="deepseek-v4-flash-0731",
input="把这 20 条评论按【求链接/夸图/问养护/负面】四类归档")
print(r.output_text)
EOF
5. ayghri/i-have-adhd —— 让编程 Agent 别把答案埋在废话里
Agent SkillMIT跨客户端
一句话定义:一个 10 条规则的 Skill,强制编程 Agent 先给下一步动作、多步任务编号、删掉所有开场白与「Hope this helps!」式结尾。
适用场景:这是本周最「小而准」的一个。事实上它解决的是每天都在发生但没人当回事的问题:你问一个具体问题,Agent 回你 600 字,真正要执行的那行命令埋在第 4 段。作者把《The Adult ADHD Tool Kit》的思路改写成 LLM 回应规则,效果是回答直接以 Run npm install ...,then edit src/auth.ts:42 开头。更重要的是,它对主流客户端都做了适配:Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、Antigravity。作者自己说:「无需 ADHD 诊断也能用。」
落地步骤:
# Claude Code claude plugin marketplace add ayghri/i-have-adhd claude plugin install i-have-adhd@i-have-adhd # 会话内输入 /i-have-adhd 启用;想每次自动启用: touch ~/.claude/.i-have-adhd-always # Codex codex plugin marketplace add ayghri/i-have-adhd --ref main codex plugin add i-have-adhd@i-have-adhd # 会话内输入 $i-have-adhd 显式应用
6. TencentCloud/TencentDB-Agent-Memory —— 团队级 Agent 记忆中枢
Agent 记忆MIT自托管四类资产
一句话定义:把对话、文档、代码转成四种可复用的记忆资产(Chat Memory / Skill / LLM-Wiki / Code-Graph),跨 Agent 与框架统一治理、共享、装备。
适用场景:上期我们推过 deja-vu(单人的编程 Agent 记忆层),这个是团队版。首先看它的分层蒸馏设计:L0 原始对话 → L1 原子事实 → L2 场景 → L3 人物画像,比「把历史对话塞进向量库」精细得多。其次,Skill 资产能从真实对话与工具调用里自动提取,带版本、资源文件、触发边界、执行步骤和校验规则,个人默认私有、审核后团队共享。另外 Code-Graph 索引代码符号、文件与调用关系,能做影响面分析。目前集成 OpenClaw、Hermes 与 SDK 三种方式。
落地步骤:
git clone https://github.com/Tencent/TencentDB-Agent-Memory.git cd TencentDB-Agent-Memory/deploy/global-images cp .env.example .env $EDITOR .env # 填两组 LLM 参数:memory group + proxy group ./start-all.sh # 一键起 memory-core + memory-hub + proxy # 控制面板:http://localhost:8125 # 脚本结束会打印可直接粘贴给 Claude 的接入指令 # 从 v1.x / v0.x 迁移:MemoryCore/scripts/migrate-v2-to-v3/
7. opengeos/GeoLibre —— 浏览器、桌面、Jupyter 都能跑的轻量 GIS
地理可视化云原生Jupyter格式转换
一句话定义:轻量云原生 GIS 平台,同一套内核跑在 Web 浏览器、桌面端、移动端和 Jupyter Notebook 里。
适用场景:做数据可视化项目时,地理维度一直很尴尬——QGIS 太重、Kepler.gl 太玩具、自己写 Mapbox 又要处理一堆瓦片。GeoLibre 的定位刚好卡在中间。值得注意的是它内置的格式转换很实用:Vector→GeoParquet、Raster→COG、CSV→GeoParquet、Vector→FlatGeobuf/PMTiles,部分转换走浏览器 WASM,不用装 GDAL。例如你手上有一份带经纬度的 CSV(花卉分布、门店位置、用户地域),可以直接转成 GeoParquet 后在 Notebook 里出图。此外还支持 OGC Vector Tiles、Esri 矢量瓦片服务、ArcGIS Pro 项目导入(.aprx / .mapx),以及 Socrata / CKAN / ArcGIS Hub 开放数据目录。
落地步骤:
# Python 包(zsh 下 extras 记得加引号)
pip install "geolibre[all]"
# Jupyter 中使用
jupyter lab
# import geolibre
# m = geolibre.Map()
# m.add_data("flowers.csv", lat="latitude", lon="longitude")
# m
# Docker(镜像内置 sidecar,转换能力开箱可用)
docker run -p 8080:8080 opengeos/geolibre
8. Poth Labs —— 把客户知识从「文档堆」变成「关系网络」
消费者洞察关系建模自适应调研
一句话定义:先给客户群建一个「活的关系模型」再回答问题;证据不足时自动发起自适应调研去补齐缺失数据。
适用场景:大多数「问答式知识库」的做法是检索几篇文档然后总结,问「为什么用户流失」只能给你三条零散引用。Poth 的差异在于先建模再回答——它把客户知识理解成关系网络而非文档集合,因此能跨源推理出单一文档答不了的问题。然而要注意,这类工具的价值高度依赖你喂进去的素材质量:评论、访谈、客服记录越完整,模型越准。它要求每条结论可追溯到证据,答不出来时不编,而是发调研去收。
落地步骤:
# 1) 导出素材:评论 + 私信 + 社群聊天记录 # 可用上期推荐的 MediaCrawler 批量导出评论区(注意平台规则与合规) python main.py --platform xhs --type creator --creator_id <你的ID> --get_comment # 2) 清洗成 CSV:user_id, content, note_id, date, like_count # 3) 上传建模,然后直接问: # 「哪类内容带来的收藏最多但转化最差?」 # 「提到『养不活』的用户,主要卡在哪个环节?」
二、WorkBuddy 生态动态
Browser-BC(原 Journey Forge Local):录一遍网页操作,自动蒸馏成 Skill
传统做浏览器自动化 Skill,靠的是把步骤写清楚交给 Agent,很容易被上下文干扰。Browser-BC 换了路子:浏览器行为克隆——先录制真人的网页操作轨迹,再由大模型从轨迹里提取操作逻辑,自动蒸馏成可直接在 WorkBuddy 调用的 Skill。
流程是:部署 Browser-BC 并启动服务 → 接入 DeepSeek / GLM 等大模型 API → 工具自动生成 Chrome 扩展 → 浏览器开发者模式加载插件 → 开启录制并手动完成一遍操作 → 上传轨迹 → 蒸馏出 Skill。教程里的示例是 B 站自动点赞,但这套方法对「批量收藏 / 数据看板每日截图 / 后台报表导出」这类重复网页操作同样适用。综上所述,它把「写 Skill」变成了「演示一遍 Skill」,对不写代码但要跑自动化的运营岗友好度提升明显。
三、历史推荐追踪(过去 4 周 AI工具推荐 汇总)
2026-07-30(第 28 期)
- every-app/open-seo —— 开源 Semrush / Ahrefs 替代,本地 SEO 审计
- NanmiCoder/MediaCrawler —— 小红书 / 抖音 / B站 / 微博 / 知乎 多平台爬虫
- virgiliojr94/book-to-skill —— 技术书 PDF → Claude Code Skill
- bojieli/ai-agent-book · citrolabs/ego-lite · microsoft/VibeVoice · different-ai/openwork · MoonshotAI/Kimi-K3
2026-07-27(第 27 期)
- Heard —— 给编程 Agent 加语音监控 | claude-video —— 让 Claude 看视频
- stablyai/orca —— 并行 Agent 舰队 | vshulcz/deja-vu —— 编程 Agent 记忆层
- Nutlope/hallmark · Speech To Markdown · tt-a1i/archify · Referivo
2026-07-24(第 26 期)
- Teable 3.0 · ditto.site · Rerun · CartAI · Kronos · worldmonitor · alibaba/open-code-review · AgentManager
2026-07-21(第 25 期)
- OpenCut · grok-build · langchain-ai/openwiki · VocalVia · Klon AI · Tiptap AI Toolkit · Agentcard · Graphify
📌 本期去重:Agent-Reach、last30days-skill、openwork、Context.dev 本周仍在 Trending 与榜单上,但已在往期推荐过,不重复计入。累计已推荐工具 199 个。
💡 品类赛道应用提示:高端美妆营销
结合本期推荐的工具,以下方向值得高端美妆 / 奢华护肤品牌的营销团队关注。这一板块面向美妆营销从业者,只讨论品类赛道层面的通用打法。
1. 内容输出:AIGC 物料 + 多平台内容日历
高端美妆的内容困境不是「产不出」,而是「产得起但审不动」——一支 15 秒的质感短片,传统外包周期两周、单条报价 3–8 万元,一个季度做不了几条。MiniMax H3 改变的是这条成本曲线:2K 分辨率 0.8 元/秒,15 秒成片约 12 元,而且它在文字与品牌信息呈现上专门做过优化——这对必须准确渲染品牌标识、产品名、成分名称的美妆物料是硬指标(多数视频模型在这一项上会糊字)。
具体而言,一套可跑的内容流水线是这样的:
- 母版素材:产品实拍图 1 张 + 品牌调性参考视频 1 支 + 品牌音频 ID 1 段,作为 H3 的多模态上下文输入;
- 批量衍生:用 V2V 动作迁移把同一套运镜迁移到不同 SKU,一次 prompt 换产品图即可出新片;
- 多平台裁切:Capptivo 负责教程与使用演示类内容的录制和竖屏裁切,一次录制导出 16:9 与 9:16 两版,分别进长视频平台与小红书 / 抖音;
- 内容日历:把选题表的 prompt 列接进批量调用脚本,配合 DeepSeek-V4-Flash 做文案初稿与标题变体(同一支视频出 5 版标题做 A/B)。
换句话说,周更内容产能可以从「20 小时产 5 条」压到「6 小时产 15 条」,省下的主要是等外包和来回改稿的时间,而不是创意时间。需要提醒的是,高端品类对质感容错极低,AIGC 更适合做中腰部内容与素材变体(成分科普、使用演示、场景氛围、节点海报动效),主视觉与代言人内容仍建议实拍。把 AIGC 当作「填满内容日历的中间层」,而不是替代 TVC。
2. 社媒监听与竞品内容策略洞察
Poth Labs 的「先建关系模型、再回答问题」这一设计,用在美妆社媒监听上比传统舆情工具更对路。传统舆情给你词频和情感极性,回答不了「为什么这条爆了」。把竞品近半年的爆文评论区、KOC 笔记、客服记录导入建模后,可以直接追问:「客单价 800 以上的护肤品类,用户在评论区最常质疑的三件事是什么?」或「哪种内容形态收藏高但转化差?」
操作路径上,素材采集可以用公开的多平台爬虫工具批量导出评论与笔记元数据(务必遵守平台规则与合规要求),清洗成 CSV 后进模型。值得注意的是,Poth 在证据不足时会主动发起自适应调研补数据,这比「硬编一个结论」更适合要对营销预算负责的场景。产出物是一页纸的竞品内容套路拆解:话题切口、发布节奏、KOC 层级配比、爆文结构。
3. 消费者洞察与品牌内容资产沉淀
美妆营销团队人员流动快,最贵的隐性成本是「品牌调性知识」跟着人走。TencentDB Agent Memory 的四类记忆资产在这里有直接价值:把历年 brief、调性手册、审稿意见、被毙掉的方案与原因,蒸馏成 L1 原子事实与 L3 品牌画像,新人和 AI 工具都能直接挂载。与此同时,Skill 资产可以把「怎么写符合本品牌调性的种草文案」这类隐性经验固化成带校验规则的可复用技能,而不是躺在某个人的收藏夹里。
另外,若品牌自建 DTC 站点或做节点专题页,Instatic 这类自托管可视化 CMS 值得评估:营销团队可视化搭页、产出静态页面、首屏加载通常可压到 1 秒内——对高客单价品类,首屏每快 1 秒对应的转化差异是实打实的。
4. 虚拟试妆 / AI 导购原型(视能力谨慎评估)
本期工具里,H3 的「图像参考 + 视频编辑 + V2V 动作迁移」能力理论上可以做妆效演示原型:同一张模特图,换不同色号唇釉的上妆效果动图。然而要坦率说明,通用生成模型在色彩精准度上目前达不到色号级还原(真实色号与屏幕呈现的偏差在高端彩妆是致命问题),因此现阶段更适合做氛围级妆效展示与创意提案演示,不适合直接对消费者承诺「所见即所得」。真正的虚拟试妆仍需专用 AR 试妆引擎。总的来说,这个方向值得做小规模验证,但不建议本季度投入主要预算。
四、本期小结
事实上,这三天最值得记的不是某个单品,而是两条趋势线的交叉:
第一,视频生成模型开始开权重。MiniMax H3 是国产视频生成大模型第一次面向社区开放权重,而且设计初期就考虑了国产芯片兼容。这意味着接下来几个月,「本地跑视频模型」会像今天「本地跑 LLM」一样普通。因此,现在就把内容流水线的接口层抽象好(prompt 表 → 调用层 → 后处理),等权重放出来可以无痛切本地。
第二,建站与 CMS 在往回收。Instatic 明确对标 Webflow / Framer / WordPress 三家,本周涨 2,500 星。这跟上期 open-seo 对标 Ahrefs、openwork 对标 Claude Cowork 是同一条线——把 SaaS 搬回本地已经不是零星现象,而是本季度 GitHub Trending 的主旋律。
最后但同样重要的是,Agent 记忆从个人层走向团队层(TencentDB Agent Memory),Skill 从「手写」走向「录制蒸馏」(Browser-BC)。总之,工具链在往「更低门槛、更少代码、更多可复用资产」的方向收敛,这对不写代码但要跑自动化的人是好消息。
📚 延伸阅读
AgentPeng · AI工具与Skill自动扫描 · 2026-08-02 生成
数据来源:GitHub Trending(日榜 / 周榜)、Product Hunt(7/31–8/2 日榜)、MiniMax 官方博客、公开技术资讯

Bluesky 讨论
在 Bluesky 上查看暂无回复。去 Bluesky 上抢先评论吧!