Experience-摆渡
码龄9年
求更新 关注
提问 私信
  • 博客:91,710
    问答:7
    91,717
    总访问量
  • 71
    原创
  • 121
    粉丝
  • 78
    关注
IP属地以运营商信息为准,境内显示到省(区、市),境外显示到国家(地区)
IP 属地:四川省
加入CSDN时间: 2017-11-08

个人简介:走一步,再走一步

博客简介:

wukuncsdn的博客

查看详细资料
个人成就
  • 获得498次点赞
  • 内容获得20次评论
  • 获得395次收藏
  • 博客总排名19,035名
  • 原力等级
    原力等级
    3
    原力分
    365
    本月获得
    71
创作历程
  • 48篇
    2026年
  • 1篇
    2025年
  • 7篇
    2024年
  • 1篇
    2023年
  • 1篇
    2022年
  • 5篇
    2021年
  • 4篇
    2020年
  • 6篇
    2018年
成就勋章
TA的专栏
  • DeepSeek Harness 实战
    5篇
  • 网页信息的触手
    5篇
  • otter专题
    5篇
  • zookeeper应用
    2篇
  • rocketMQ
    2篇
  • JAVA
    2篇
  • Mapped Statements collection does not contain value for 解决方法
  • Maven
    1篇
  • Spring
    2篇
  • 微信公众号开发
    2篇
  • Mapped Statements collection d
  • 服务器配置(URL)
    2篇
  • 为公众号获取用户信息

TA关注的专栏 5

TA关注的收藏夹 0

TA关注的社区 1

TA参与的活动 1

兴趣领域 设置
  • Java
    javaspringkafkaspring bootspring cloudjvmmybatisdubbojava-rocketmq
创作活动更多

AtomGit「码动四季·开源同行」秋季征稿活动

秋季征稿主题:开源成果经验分享 成果不止一种形态,我们为你准备了六大赛道,总有一款适合你: 开源项目成果复盘 把项目一年/一季的成长摊开来看:里程碑复盘、Star 与用户增长复盘、版本迭代复盘、从 0 到 1 的发布复盘。 🖊️ 示范选题: ●开源项目从 0 到 1000 Star,我做对了什么 ●开源一周年,我交出的成绩单 这类文章不只是一次经验分享,也是一张项目名片。欢迎将项目托管到 AtomGit 并申请成为 G-Star 项目,通过后可获得平台流量推荐、项目宣传等权益。(G-Star:AtomGit 最具影响力开源项目) ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/1f90c61528ad410d8d66f9d0e3707a5a.png) 咨询 G-Star 项目申请 2️⃣ 技术经验体系化沉淀 踩坑合集、最佳实践总结、工具链实战、CI/CD 流水线搭建、代码重构与架构演进。 🖊️ 示范选题: ●提了 50 个 PR 后,我总结的开源协作避坑清单 ●一次重大重构复盘:把单体拆成可维护的模块 3️⃣ AI 赋能开源的实战成果 AI 编程助手实战测评、基于开源模型的微调与应用开发、AI 辅助研发提效流水线。 🖊️ 示范选题: ●我用 AI 编程助手把提 PR 效率翻了 3 倍 ●基于开源大模型搭了个 XX 工具(附完整教程) 4️⃣ 开源共建笔记|文档、社区与布道 开源文档写作与翻译、issue 互助经验、组织 meetup、用开源项目做教学与分享。 🖊️ 示范选题: ●一个优秀开源项目,文档应该怎么写 ●我用开源项目做了个线上 Workshop ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/23e83ceebc594c379f7fc6aa8dcfa40c.png) 扫码加入码动四季投稿交流群,和更多伙伴一起交流技术!

39人参与 去参加
  • 最近
  • 文章
  • 专栏
  • 代码仓
  • 资源
  • 收藏
  • 关注/订阅/互动
更多
  • 最近

  • 文章

  • 专栏

  • 代码仓

  • 资源

  • 收藏

  • 关注/订阅/互动

  • 社区

  • 帖子

  • 问答

  • 课程

  • 视频

搜索 取消

开源社媒舆情 Agent 横评:6 个项目谁值得上手,谁只是 Demo

最近在选社媒舆情 / 社媒研究方向的 Agent 工具,顺手翻到一篇推荐清单,但越看越觉得里面几个项目的"成熟度"和实际星数对不上。这篇文章把人带进"主流生态很多选择"的错觉,可真实用户只有个位数星、有的甚至没有 License。于是我直接按 GitHub API 把清单里 6 个项目全部拉了实时数据,逐一看架构、看 License、看更新频率,整理成这份「能复用 + 值得借鉴 + 别碰」三档选型心得。希望帮你省下踩坑时间。
原创
博文更新于 13 小时前 ·
31 阅读 ·
0 点赞 ·
0 评论 ·
1 收藏

gpt-crawler 深度调研:URL 一键批量抓取生成自定义 GPT 知识库

gpt-crawler 是一个配置友好、开箱即用的 URL→知识库工具,适合个人小范围抓取公开文档。做好依赖版本管理,可作为私有知识库自动化流水线的一个轻量前置组件。(完)
原创
博文更新于 前天 22:17 ·
204 阅读 ·
1 点赞 ·
0 评论 ·
2 收藏

MediaCrawler舆情分析系统实测:7大平台爬虫的商用授权红线与风控现状

技术路线已定:使用 MediaCrawler 采集小红书/抖音/微博互动数据决策:商业用途 + 可接受账号风险核实日期:2026-09-08(GitHub API 实时数据)
原创
博文更新于 2026.09.08 ·
214 阅读 ·
3 点赞 ·
0 评论 ·
3 收藏

camofox-browser深度调研:反爬引擎新路线还是供应链陷阱

上游 daijro/camoufox(11,736 星,MPL-2.0,C++,2024-07 创建,仍在活跃)证明引擎真实存在且成熟。对照 Scrapling 235 星/天、Crawl4AI 96 星/天,绝对增速不算最快,但在反爬这个品类里,项目年龄这么短就到这个量级已经很少见。顺带说一句,这种"用 GitHub Issues 做生产环境崩溃上报"的设计本身也不太合适——既增加维护者排查成本,也污染对外呈现的健康度信号。但"声称隔离"和"审计通过"是两回事,README 没有第三方审计背书。
原创
博文更新于 2026.09.08 ·
312 阅读 ·
4 点赞 ·
0 评论 ·
6 收藏

2026反爬工具选型实测:Scrapling为何是开源生态反爬最强

但本次调研发现一个被广泛误解的点,必须先讲清楚:**“反爬绕过能力强"并不等于"单发 HTTP 请求就能破 Cloudflare”。本文的实测结论基于 2026-09-08 的状态,防护策略和绕过技术在持续演进,半年前的结论可能已经过时。这是本次调研最有价值的发现——很多文章把"TLS 指纹伪装"当成反爬银弹,实际上它只解决了反爬链条的第一环。如果需要的是"让 AI 自己操作网页完成多步任务",那需要 browser-use,而不是爬虫。,是基于相似度算法的确定性匹配,比 LLM 判断更稳定、更快。
原创
博文更新于 2026.09.08 ·
311 阅读 ·
5 点赞 ·
0 评论 ·
4 收藏

TinyFish 实战:Search Fetch Agent MCP 全场景接入 Demo

但如果以后 TinyFish 加上压缩,需要按标准 gzip 处理流程(参见 CSDN 上一篇文章《urllib 抓压缩响应坑》)。真正需要付费的是复杂的多步交互场景,但那也是"按次计费、用多少付多少",不存在月度订阅绑定的问题。替换成你自己的 key,直接在终端跑。这是"实战教程"而不是"我的实测报告",定位清晰,读者拿过去就能用。如果你已经在用 Agent 框架(Claude Code、Codex、Cursor 等),最省事的接入方式是。——导航栏、广告、脚本、Cookie 弹窗全部剥离,只有正文。
原创
博文更新于 2026.09.04 ·
366 阅读 ·
10 点赞 ·
0 评论 ·
7 收藏

ego-lite 实战:源码 build + 298单测 + 纯 Node demo 跑通全流程

维度数据14,750LicenseMIT(浏览器闭源免费)单元测试298/299 通过(99.7%)编译输出44 个文件(esbuild 53ms)驱动模块11 个(nav/pointer/keyboard/locator/observe/waits/files/downloads/screencast/load/element-ops)API 总数约 80 个E2E 测试20+ 个真实场景Node 要求>= 22平台macOS only(浏览器)一句话结论。
原创
博文更新于 2026.09.04 ·
285 阅读 ·
9 点赞 ·
0 评论 ·
4 收藏

ego-lite:为AI Agent重塑的浏览器内核,4个月14.7K Star的架构拆解与本地实测

ego-lite 是当前最激进的 AI Agent 浏览器方案:它不只是"帮 Agent 操作浏览器",而是"为 Agent 重新设计浏览器内核"。14.7K star / 4 个月的成绩说明社区认可这个方向。适合的场景用 Claude Code / Codex / Hermes 做浏览器自动化需要 Agent 继承登录态访问企业内部系统多 Agent 并行操作同一浏览器(如批量数据处理)不适合的场景Linux 服务器 / Windows 环境需要完全开源可审计的浏览器自动化。
原创
博文更新于 2026.09.03 ·
348 阅读 ·
7 点赞 ·
0 评论 ·
4 收藏

MediaCrawler 小红书爬虫深度调研 七个平台通用采集工具

一、项目概览MediaCrawler 是一个开源的多自媒体平台爬虫工具,作者 relakkes(B 站:@NanmiCoder),仓库位于 GitHub 的 NanmiCoder/MediaCrawler。支持小红书、抖音、快手、B 站、微博、贴吧、知乎共七个主流平台的公开信息采集。它的核心思路不是"JS 逆向",而是:这样绕开了对前端加密算法做逆向的需求,技术门槛大幅降低。二、项目结构速览仓库下载下来后,目录大致是这样:三、小红书模块的核心文件小红书相关的核心实现全在 下面,9 个文件:四、三条采集路
原创
博文更新于 2026.09.01 ·
518 阅读 ·
7 点赞 ·
0 评论 ·
6 收藏

Browser4 实战:一条 SQL 抽取网页数据,零 Token 成本

Browser4 的核心价值不是"又一个浏览器自动化框架",而是把"抽取 + 清洗 + 排序"这三步压进一条 SQL,全程走本地数据库引擎,不产生 Token 费用。我实测的 books.toscrape.com 示例确实跑通了,四字段一查询、自动类型转换、ORDER BY 生效,返回 HTTP 200 和 8 行结果。如果你的场景是批量结构化抽取,值得一试。如果你的 Mac 是 Intel 芯片,记住走这条路,别在上浪费时间——目前官方确实没出 darwin-x64 的运行时包。
原创
博文更新于 2026.08.31 ·
499 阅读 ·
14 点赞 ·
0 评论 ·
4 收藏

GitHub 47万星免费公共API清单深度调研:收录规模、维护现状与实测

public-apis 仍是全球最大、最全的免费公共 API 清单,MIT 可商用、收录 1700+ 条且多数实测可用,适合快速寻找各类数据源;但它的维护已转向广告化 + 自动化合并,若追求精筛和可检索性,建议关注其社区分叉 public-api-lists。免责声明:本文数据为调研当日 GitHub API 实测值,Star 数与收录条目会随项目更新而变化,请以官方仓库为准。
原创
博文更新于 2026.08.30 ·
359 阅读 ·
9 点赞 ·
0 评论 ·
5 收藏

自建 IP 轮换方案实战:健康探测 + 熔断剔除 + 粘性会话

在做大规模采集时,单出口 IP 一旦被目标站标记,后续请求就会大量失败。买商业代理按量计费成本不低,而且很多场景其实用不上那么高规格的住宅 IP。本文记录一套的完整落地过程:用多台服务器作为出口,自己实现健康探测、熔断剔除、轮询分配和粘性会话,并接入 crawl4ai 0.9.1 实测跑通。
原创
博文更新于 2026.08.29 ·
367 阅读 ·
7 点赞 ·
0 评论 ·
6 收藏

腾讯开源 BrowserSkill 实测:让任意 AI Agent 复用你的已登录浏览器

让 AI Agent 借你已有的登录浏览器去干活,而不是另起炉灶。它的三个抓手——真实登录态、不锁 Agent、内置人工协作——恰好补了当前主流方案的空白。实测下来,安装环节唯一的小坑是github.comrelease 直链在国内不稳定,走镜像下载二进制即可解决;CLI 自身的诊断(statusdoctor)做得很扎实,每一步该不该继续一目了然。录制的"录一遍、换参回放"思路也很实用,尤其适合后台类重复操作。它不是万能钥匙——纯爬虫、大规模无头、桌面级 RPA 它都不碰。
原创
博文更新于 2026.08.28 ·
432 阅读 ·
4 点赞 ·
0 评论 ·
3 收藏

SkillOpt 实战:从 pip 安装到首个技能训练的全流程

场景推荐工具关键步骤快速体验零成本了解工作流有标注数据配置 → 训练 → best_skill.md评估已有技能指定 skill 文件 + 配置日常进化夜间自动采集→优化→提案SkillOpt 的核心价值不在于「用 LLM 改 prompt」——而在于它把验证门控、学习率调度、慢更新等深度学习训练机制完整地搬到了文本空间,使技能优化变得可复现、可回退、可度量。本文所有输出为实际安装和运行结果。
原创
博文更新于 2026.08.27 ·
153 阅读 ·
4 点赞 ·
0 评论 ·
3 收藏

CloakBrowser实战从安装到绕过反爬检测Playwright无缝替换指南

CloakBrowser 的核心价值在于:它将反检测能力内置于浏览器二进制,而非运行时注入。这使得它在面对 reCAPTCHA v3、Cloudflare Turnstile 等主流反爬系统时表现显著优于传统工具。通过 Playwright 100% 兼容的 API,CloakBrowser 可以无缝替换现有 Playwright 脚本,学习成本几乎为零。一句话结论:CloakBrowser 的安装和使用流程与 Playwright 几乎一致——只需替换一行 import 语句,即可获得源码级反检测能力。
原创
博文更新于 2026.08.27 ·
357 阅读 ·
3 点赞 ·
0 评论 ·
5 收藏

CloakBrowser源码级反检测Chromium深度调研reCAPTCHA v3 0.9评分揭秘

CloakBrowser 代表了反检测浏览器自动化领域的一次范式转变:从"运行时补丁"走向"源码级补丁"。其 30K 星标、0.9 的 reCAPTCHA v3 评分、以及 Playwright 100% 的 API 兼容性,使其成为当前开源生态中技术含量最高的反检测浏览器方案。对于关注爬虫对抗、浏览器自动化、数据安全审计等方向的开发者,CloakBrowser 值得深入研究和实战验证。一句话结论。
原创
博文更新于 2026.08.27 ·
350 阅读 ·
8 点赞 ·
0 评论 ·
7 收藏

Headroom:开源 AI 智能体上下文压缩工具,最高节省 95% Token 成本

Headroom 是目前最成熟的开源 AI Agent 上下文压缩方案,通过本地代理模式实现 60%-95% 的 JSON 数据和 15%-20% 的代码场景 Token 节省,且对回答质量几乎无影响。四种接入方式覆盖了从个人开发者到团队协作的各类场景,CCR 可逆压缩设计确保了数据安全。对于每天重度使用 AI 编程 Agent 的开发者来说,Headroom 是一个值得尝试的工具——同样的工作,更低的账单。免责声明:本文为技术调研文章,所有数据来源于 GitHub 仓库、PyPI 发布页和官方文档。
原创
博文更新于 2026.08.25 ·
176 阅读 ·
5 点赞 ·
0 评论 ·
5 收藏

Defuddle 实战手册:从 CLI 到 Node.js API 的 8 组对比测试

测试场景推荐用法关键指标快速提取正文102ms / 143词批量脚本处理--jsonjq一次拿全元数据知识库入库排查误删内容--debug评分+移除明细只取元数据单字段输出反爬/登录页curl管道自定义 header编程集成46ms / 33词LLM 上下文准备--markdown15.3x 压缩Defuddle 的 CLI 覆盖了从快速提取到脚本化批处理的完整场景链。配合 Node.js API,可以在任何需要网页内容提取的环节直接嵌入。或本文所有输出均为实际终端运行结果。
原创
博文更新于 2026.08.24 ·
293 阅读 ·
4 点赞 ·
0 评论 ·
5 收藏

SkillOpt 源码深度解析:微软如何用训练神经网络的方式优化 Agent 技能

SkillOpt 的贡献不在于「用 LLM 优化 prompt」——这个想法很多人都有。它的贡献在于把深度学习训练的全套纪律搬到了文本空间:验证集、门控、学习率调度、动量、元学习,每个机制都有对应实现。离线训练:如果你有标注好的评估数据集,用 SkillOpt 训练出,部署时零额外成本夜间进化:如果 Agent 在生产环境运行,SkillOpt-Sleep 提供了一种「白天干活,晚上进化」的闭环论文:https://arxiv.org/abs/2605.23904。
原创
博文更新于 2026.08.24 ·
550 阅读 ·
6 点赞 ·
0 评论 ·
5 收藏

动手实测 Defuddle:拆解 Obsidian 创始人的网页内容提取引擎

Defuddle 不是 Readability 的简单复刻,而是一次从 Obsidian 生态需求出发的重新设计。管道式清除架构,每个阶段独立可调22+ 站点专用提取器,覆盖主流平台三套构建产物,按场景选择体积完整的调试模式,开发者可以精确追踪每次提取的决策过程如果你正在做网页内容提取相关的工作,无论是笔记工具、RSS 阅读器还是 AI 数据管道,Defuddle 都值得认真评估。本文所有结论均基于对 GitHub 源码(commit 最新)的分析和实际命令行测试。
原创
博文更新于 2026.08.24 ·
208 阅读 ·
6 点赞 ·
0 评论 ·
6 收藏
加载更多