谁来评判评判者?在 Elasticsearch Workflows 中使用 LLM-as-a-Judge 摘要:Elasticsearch推出基于工作流的RAG评估方案,通过两个Claude模型实现自动化测试。小模型(Haiku)负责回答知识库问题,大模型(Sonnet)从正确性(0.74)、忠实性(0... AI 3个月前260
随机 User-Agent 为什么越来越不够用:爬虫与自动化项目需要的其实是 UA 基础设施 随机 UA 只能解决“有字符串可换”,却解决不了真实结构、分类筛选、池化轮换和生产交付问题。本文从爬虫与自动化测试场景出发,讨论为什么正式项目需要一套更完整的 User-Agent 基础设施。 AI 3个月前260
《Science》观点解读:AI无法创造真正的智能体(AI Agent) Science文献解读:AI无法生成真正的AI Agent。未来或许可能出现更接近智能 agent 的 AI 系统,我们可以讨论如何应对这些假设的 AI 系统,但大模型并非这样的系统,它们更像印刷术... AI 3个月前260
AI辅助性能瓶颈定位:从火焰图到智能根因推断的工程链路 AI辅助性能定位的核心价值不在于"替代专家",而在于将专家的注意力从数据收集和初步分析中解放出来。一个熟练的工程师在拿到性能数据后,大约要花70%的时间做"信息整理&qu... AI 2个月前250
AI 辅助创作工程化:从 Prompt 拼接到结构化生成管线 创作者对 AI 写作的要求其实不复杂:给个主题和风格,能稳定产出能用的内容。但实际用起来,直接拼个 Prompt 丢给大模型,结果波动很大。同一套 Prompt 跑两次,风格可能完全不同。批量生产时... AI 2个月前250
2026年,大模型的使用门槛终于被拉平了——聊聊AI聚合平台的演进 本文探讨了AI API聚合平台的发展历程与趋势。随着大模型数量激增,普通用户面临使用门槛高、接口分散等问题。行业经历了从API中转站(解决开发者接口统一问题)到AI聚合平台(实现普通用户零门槛体验)的... AI 2个月前250
AI效率工具产品化:用户访谈驱动的PMF验证方法 本文围绕AI效率工具的产品化验证,提出了一套以用户访谈为核心、以结构化数据量化为手段的PMF验证方法。三层访谈框架:从场景探索到方案验证再到价值锚定,逐层收敛信号强度;标签化数据结构:将定性访谈转化为... AI 3个月前250
招投标项目越多越容易乱,我用飞算JavaAI搭了个采购管理平台 摘要: 企业招标管理常面临台账分散、评标手工操作、合同断档等痛点。为解决这些问题,采用敏捷开发思路,聚焦核心功能(投标台账、评标打分、中标阶梯、合同归档),基于飞算JavaAI快速搭建Vue 3前端系... AI 3个月前250