欢迎来到HTML时代

HTML的核心设计思想,从一开始就不是"怎么让网页好看",而是"这是什么"。你写<h1>实验报告</h1>,你是在声明:这是一个标题。你写<a href="...">参考文献</a>,你在声明:这是一个链接。你写<table>,你在声明:这些数据有结构。
这叫声明式标记,你描述内容的语义,不描述它该怎么显示,显示是浏览器的事。这个选择看起来不起眼,但它做对了一件事:意图和呈现分离。
HTML还有另一个被低估的品质:容错。你可以忘了闭合标签,可以属性乱写,可以嵌套出错——浏览器照样渲染。HTML的解析器是全世界最宽容的解析器,它对人的不规范近乎纵容。
再加上一条:HTML是纯文本。人能直接读,打开记事本就能看懂。不需要编译,不需要特殊工具,不需要专业知识。它不偏科——机器能解析,人也能看。
声明式、容错、文本可读。三个特性,让HTML成了互联网的母语。三十五年来,技术在变,HTML的骨架没变。
伯纳斯-李大概没有想到,这个为物理学家写论文方便的发明,有一天会被人重新发现——不是因为网页更漂亮了,而是因为另一个读者来了。
2025年,Imperva发布年度机器人报告,一个数字藏在报告中间:自动化流量在十年来首次超越人类活动,占据全网总流量的51%。
超过一半的互联网流量,不是人产生的。
Adobe Analytics追踪了超过一万亿次美国零售网站访问,2024年底假日购物季,来自生成式AI的流量同比增长1300%。半年后的2025年7月,这个数字变成4700%。
Cloudflare雷达数据显示,AI爬虫流量在一年内增长了15倍。
Gartner的预测更直白:到2028年,90%的B2B采购将由AI Agent直接发起、评估并完成,驱动超过15万亿美元的经济流转。
这些数字指向同一件事:互联网正在换读者。访问网页、阅读内容、点击按钮、完成交易的主体,正在从人变成Agent。
这件事的直接后果是:网页要重新设计。
过去三十年,所有网页设计的核心问题是"人怎么看"。优化视觉层级,精心设计留白,打磨能刺激多巴胺的交互按钮,指标是"页面停留时间"和"点击率"。
现在,你的主要访客是一个没有眼睛的东西。
Agent看网页有两种方式。第一种是API调用——直接请求结构化数据,干净、高效、省token。但现实是,大量网站没有可用的API,或者API被严格限制。于是Agent只能用第二种方式:打开浏览器,像人一样去读网页。
问题来了。一个典型的电商页面,直接把原始HTML喂给大语言模型,要消耗数万乃至十万级别的token。HTML里充满了人类视觉需要的噪音——CSS类名、布局div、装饰性svg、追踪脚本。Agent不需要这些。它只需要知道:这里有一个按钮,按钮上写着"确认支付",按钮当前可点击。
一个为眼睛设计的格式,现在要喂给一个没有眼睛的读者。
解决办法正在涌现,每一条都意味深长。
第一条路:把HTML翻译成纯文本。
2026年初,Cloudflare发布了"Markdown for Agents"功能。当AI系统请求一个网页时,可以在请求头里声明自己偏好markdown格式,Cloudflare就把HTML转换成干净的markdown返回。token消耗降低80%。最流行的编程代理——Claude Code、OpenCode——已经在发送这种请求头了。
GitHub上有一个叫Firecrawl的项目,八万多个star。自我介绍一句话:"The Web Data API for AI — Turn entire websites into LLM-ready markdown."把整个网站变成大模型能吃的markdown。
但markdown有个致命问题:它抹掉了所有交互信息。Agent能读懂一篇文章,但不知道怎么点按钮。
第二条路:让Agent直接操作浏览器。
微软给出了这个方案。2025年,Playwright MCP发布,Agent可以像人一样打开浏览器、点击、输入、滚动。但Agent看到的不是渲染后的画面——它看的是一棵树。
这棵树叫可访问性树(Accessibility Tree,简称AXTree)。
这是整个故事里最讽刺的部分。
可访问性树最初是浏览器为视障人士设计的。当浏览器解析HTML时,会同步生成一棵AXTree——剥离所有纯视觉和样式节点,只保留具备实际语义和交互意义的元素:这是一个按钮,名字叫"确认支付",状态是"可点击"。
这棵树让token消耗比原始DOM减少90%。而且它保留了交互信息——Agent不仅知道页面上有什么,还知道怎么操作。
为盲人设计的技术,成了Agent的眼睛。
那些被视觉排版淹没的语义结构,那些前端开发者从来不关心的aria-label和role属性,突然成了互联网最重要的基础设施。过去二十年,aria-label被当成可访问性的"额外加分项"——做了更好,不做也没人在乎。现在,不做就意味着Agent看不懂你的网站。
第三条路:为Agent重新造一个网。
2025年,UC Berkeley、UCL、上海交通大学等机构的研究者联合发表了一篇论文,《Agentic Web: Weaving the Next Web with AI Agents》。论文提出:人类不再是唯一的网络使用者,智能体将成为Web的主要操作者。
在这个框架里,Agent有双重身份:既是用户——像人一样访问网页、填写表单、读取数据;也是接口——接收人的自然语言指令,自动解析、调用多个服务、整合结果。
你不再"上网"。你说出一个目标,Agent替你上网。
零售行业已经在跟进。2025年11月,New Gen公司发布了Kepler——零售业第一个"Agentic Commerce平台"。它帮品牌把商品目录转成AI可读的数据,让网站能用自然语言回答购物者和AI Agent的问题。他们还推出了"Agent Score"——给网站打分,衡量AI Agent能在多大程度上顺利浏览和购物。早期结果:大多数零售网站的得分远低于预期。
三条路,同一个方向:把HTML里"这是什么"的语义信息,从视觉渲染的壳里剥出来,单独喂给Agent。
所以为什么是HTML?
不是因为它漂亮,不是因为它先进,不是因为它有最大的生态。这些是结果,不是原因。
原因是:HTML从第一天起就是一个人机协议。
回到那三个特性。
声明式——你描述语义,不描述呈现。人和机器各取所需:人读标签知道结构,机器读标签知道意图。这个分离,在只有人看网页的年代是多余的优雅,在Agent来了之后变成了天然的接口。
容错——HTML的解析器对不规范无限宽容。人写的东西本来就是乱的,HTML不要求你写得对,只要求你写得"差不多能猜"。这个品质让HTML在过去三十五年被数十亿人乱写乱用却从未崩溃。而Agent——你看,大语言模型最擅长的恰恰是"从不太规范的输入中猜出意图"。HTML的容错和大模型的模糊理解,天生一对。
文本可读——HTML是纯文本,不编译,不加密,打开就能看。这意味着任何能处理文本的工具都能处理HTML。大语言模型的输入就是文本。HTML不需要任何转换就能被LLM直接读取——虽然需要清理,但不需要解码。
三层叠加,你会发现一件事:HTML在1989年被设计出来时,它的设计者想的是"让人方便地共享文档"。但他的设计选择——声明式语义、宽容解析、纯文本格式——恰好满足了一个三十五年后才出现的需求:让机器也能读懂人的文档。
不是巧合。是因为HTML解决的本质问题——"怎么让人和机器都能理解同一份文档"——从来没有变过。只是过去机器的角色是渲染,现在机器的角色变成了理解。
伯纳斯-李造的是一把钥匙。他以为这把钥匙开的是"人看文档"这扇门。三十五年后我们才发现,这把钥匙开的是"人和机器共享语义"这扇门。
所以"HTML时代"是什么意思?
伯纳斯-李发明HTML时,想的是让物理学家看论文。他不会想到,三十五年后,读HTML最多的东西不是人。他更不会想到,让Agent真正"看见"HTML的,是一棵为盲人准备的树。
工具一旦被造出来,就不属于造它的人了。
你的组织也在分层——标签是规则,内容是判断,跟HTML一个结构。
你此刻用的每一个系统、每一个流程——它到底是给谁设计的?
欢迎来到HTML时代,以及:让你的Ai Agent写个HTML给你,而不是你习惯的word。
现在,去试试。
注:转载文章来源于网络,版权归原作者或企业所有,侵删!