发布时间:2023-06-16
点击次数: 俗话说,见字如面,字如其人。相比呆板的打印字体,手写体更能体现书写者的个人特点。相信很多人都曾设想过,拥有一套属于自己的手写字体,用在社交软件中,更好的展示自己的个人风格。
然而,不同于英文字母,汉字数量是极其庞大的,想要创造一套自己的专属字体代价十分高昂。例如,最新发布的国标GB18030-2025中文字符集包含8万多个汉字。有报道称,某视频网站博主花了18个小时写完了7000多个汉字,中间耗费了足足13支笔,手都写麻了!
上述问题引发了论文作者的思考,能否设计一个文字自动生成模型,帮助解决专属字体创造代价高的问题呢?为了解决这一问题,研究者设想提出一个会笔迹模仿的 AI,仅需用户提供少量的手写样本(大约 10 几张),就能提取笔迹中蕴含的书写风格(例如字符的大小、倾斜程度、横宽比、笔画的长短和曲率等),并且临摹该风格去合成更多的文字,从而为用户高效合成一套完整的手写字体。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
进一步地,论文作者从应用价值和用户体验两个角度出发,对该模型的输入和输出模态做了如下思考:1. 考虑到序列模态的在线字体 (online handwritings) 比图像模态的离线文字 (offline handwritings) 包含更丰富的信息(轨迹点的详细位置和书写顺序,如下图所示),将模型的输出模态设置为在线文字会有更广泛的应用前景,例如可以应用到机器人写字和书法教育上。2. 在日常生活中,相比通过平板和触摸笔等采集设备获取在线文字,人们利用手机拍照获取离线文字更加方便。因此,将生成模型的输入模态设为离线文字,用户使用起来会更加方便!

总结起来,本文的研究目标是提出一个风格化的在线手写文字生成模型 (stylized online handwriting generation method)。该模型既能临摹用户提供的离线文字中所蕴含的书写风格,又能根据用户
需要在线生成内容可控的手写笔迹。

为了实现上述目标,研究者们分析了两个关键问题:1. 由于用户只能提供少量的字符样本,能否仅从这些少量的参考样本中学习用户独特的书写风格呢?换句话说,根据少量的参考样本临摹用户的书写风格是否可行?2. 本文的研究目标不仅需要满足生成的文字风格可控,还需要内容也可控。因此,在学习到用户的书写风格后,如何将该风格与文字内容高效的结合,从而生成满足用户期望的手写笔迹?接下来让我们看看这篇 CVPR 2025 提出的 SDT(style disentangled Transformer)方法是怎样解决这两个问题的吧。
研究动机 研究者发现,个人笔迹中通常存在两种书写风格:1. 相同书写者的笔迹存在着一种整体上的风格共性,各个字符呈现出相似的倾斜程度和宽高比,且不同书写者的风格共性各不相同。由于这种特性可以用于区分出不同的书写者,研究者们称其为书写者风格。2. 除了整体上的风格共性,来自同一书写者的不同字符间存在着细节上的风格不一致。例如,对于 “黑” 和 “杰” 两个字符,二者在字符结构上具有相同的四点水部首,但该部首在不同的字符中存在微弱的书写差异,体现在笔画书写的长短、位置和曲率上。研究者们将这种字形上的细微的风格模式称为字形风格。受启发于上述观察,sdt 旨在从个人笔迹中解耦出书写者和字形风格,期望提升对用户笔迹的风格模仿能力。

在学习到风格信息后,不同于以往的手写文字生成方法简单的将风格和内容特征进行简单的拼接,SDT 将内容特征作为查询向量,自适应的捕获风格信息,从而实现风格和内容的高效融合,生成符合用户预期的手写笔迹。

方法框架 SDT 的整体框架如下图所示,包含双分支风格编码器、内容编码器和 transformer 解码器三部分。首先,本文提出两个互补的对比学习目标来引导风格编码器的书写者分支和字形分支分别学习对应的风格提取。然后,SDT 利用 transformer 的注意力机制 (multi-head attention) 对风格特征和内容编码器提取到的内容特征进行动态融合,渐进式的合成在线手写文字。

(a) 书写者风格对比学习 SDT 提出面向书写者风格提取的有监督对比学习目标(WriterNCE),将属于相同书写者的字符样本聚集在一起,推远属于不同书写者的手写样本,显示地引导书写者分支关注个人笔迹中的风格共性。
(b) 字形风格对比学习 为了学习更加细节的字形风格,SDT 提出无监督的对比学习目标 (GlyphNCE),用于最大化相同字符不同视角间的互信息,鼓励字形分支专注学习字符中的细节模式。具体如下图所示,首先对同一张手写字符做两次独立的采样,获取一对含有笔画细节信息的正样本

和

,然后从其他字符中采样得到负样本

。每次采样时,随机选择少量样本块作为包含原始样本细节的新视角。样本块的采样服从均匀分布,避免字符的某些区域被过度采样。为了更好的引导字形分支,采样过程直接作用于字形分支输出的特征序列上。

(c) 风格和内容信息的融合策略 获取了两种风格特征后,如何将其与内容编码器学习到的内容编码进行高效融合呢?为了解决这一问题,在任意的解码时刻 t,SDT 将内容特征视作初始点,然后结合 q 和 t 时刻之前输出的轨迹点

形成新的内容上下文

。接着,内容上下文被视为 query 向量,风格信息作为 key & value 向量。在交叉注意力机制的融合下,内容上下文与两种风格信息依次完成动态聚合。
定量评价 SDT 在中文、日文、印度文和英文数据集上都取得了最优异的性能,尤其是在风格分数指标上,相比之前的 SOTA 方法,SDT 取得了较大突破。
ChatGPT Writer
免费 Chrome 扩展程序,使用 ChatGPT AI 生成电子邮件和消息。
106
查看详情


定性评价 在中文生成方面,相比以前的方法,SDT 生成的手写字符既能避免字符的崩坏又能很好的临摹用户的书写风格。得益于字形风格学习,SDT 在字符的笔画细节生成方面也能做的很好。

在其他语言上 SDT 也表现良好。尤其在印度文生成方面,现有主流方法很容易生成崩溃的字符,而我们的 SDT 依旧能够维持字符内容的正确性。

不同模块对算法性能的影响 如下表所示,本文提出的各个模块具有协同作用,有效提升了对用户笔迹的临摹性能。具体来说,书写者风格的加入提升了 SDT 对字符整体风格的模仿,例如字符的倾斜程度和长宽比等,而字形风格的加入改善了生成字符的笔画细节。相比已有方法简单的融合策略,在各项指标上 SDT 的自适应动态融合策略全面增强了字符的生成性能。


两种风格的可视化分析 对两种风格特征进行傅里叶变换得到如下的频谱图,从图中观察到,书写者风格包含更多的低频成分,而字形风格主要关注高频成分。事实上,低频成分包含目标的整体轮廓,高频成分则更加关注物体的细节。这一发现进一步验证和解释了解耦书写风格的有效性。

大家可以通过笔迹 AI 创造自己的专属字体,在社交平台上更好的表达自我!
以上就是会模仿笔迹的AI,为你创造专属字体的详细内容,更多请关注其它相关文章!
# 很好
# 网站建设技术准备
# 网站推广 收费
# 精通php和seo
# 顺昌专业seo介绍
# 微博有什么营销产品推广
# 阜平网站建设厂
# 网站建设 提案 框架
# 车辆认证网站建设流程
# 合肥网站服务器优化公司
# qq怎么做内容营销推广
# 如下图
# ai
# 模态
# 所示
# 这一
# 离线
# 两种
# 开源
# 自己的
# 为你
# stylized
# writer
# 笔迹
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
苹果2万5的AR遭遇砍单95%:不及预期
微软在 Bing 和 Edge 浏览器中拓展网购服务,帮用户选购心仪产品
智能公司为何纷纷投身机器人领域?
人工智能“Aria”现身 Opera浏览器100版本更新:新功能“标签岛”
物联网和人工智能的协同作用:释放预测性维护的潜力
站在社会的高度理解人工智能
IBM 与 NASA 携手开源地理空间 AI 模型,促进气候科学研究进步
微软新出热乎论文:Transformer扩展到10亿token
Midjourney 5.2震撼发布!原画生成3D场景,无限缩放无垠宇宙
苹果在韩举办首届中小企业智能制造论坛,加速推动工业4.0发展
Meta 发布 Voicebox AI 模型:可生成音频信息,用于 NPC 对话等
北京市元宇宙产业创新中心筹建工作正式启动
鸿蒙智能座舱的AI大模型革新,引领智能座舱领域的变革吗?
跑不动的元宇宙,虚拟世界比现实更冷酷
人工智能大胆预测:银河系至少有2万个地球,36种外星文明
大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升
AI创作广告文案等同2.47年工作经验,且消费者无法区分|AI营销前沿
RoboNeo操作教程
Spotify计划推出AI驱动的音乐播放器功能
人工智能驱动艺术,打开达利的超现实想象
AI连线 | 专访风平智能CEO林洪祥:让AI数字人拥有漂亮的外表和有趣的灵魂,安全问题是重要考量
AIGC 风潮刮到游戏产业,巨人网络与阿里云达成“游戏 +AI ”合作
江永:精准施训提升通信无人机应急救援能力
VMS的应用:提升多品牌设备管理效能
马克龙密会AI专家,法国加入全球人工智能竞赛
微盟宣布联合腾讯云共建行业大模型:加快激活AI大模型智能应用
商业智能决策技术助力降本增效,世界人工智能大会举办商业AI高峰论坛
重磅! 捷通华声灵云AICC荣获第二届光合组织AI解决方案大赛二等奖
陈根:ChatGPT和人类合作开发机器人
OpenAI宣布组建新团队 以控制“超级智能”人工智能
深度学习模型综述:用于3D MRI和CT扫描的应用
万兴播爆桌面端上线,支持AI数字人搜索、视频编辑等功能
乐天派桌面机器人加入小米米家生态系统,实现与其他智能设备的互联
金山办公宣布与英伟达团队合作,加速WPS AI服务
陈根教授:离人形机器人时代还有10年吗?
联想首发AI PC于今年秋季,英特尔CEO确认AI PC时代来临
美图公司:Wink国内首发AI画面拓展功能
NVIDIA垄断AI市场90%份额:AMD性能追上80% 软件太不能打
百川智能发布Baichuan-13B AI模型,号称“130亿参数开源可商用”
华为云盘古大模型3.0发布 AI云服务同时上线:200亿亿次性能
构建数字文旅新高地!洛阳涧西区开启元宇宙时代
最大助力35公斤 外骨骼机器人或在养老、医疗领域“大展身手”
“痴迷”元宇宙,魔珐科技想做什么?
Intel酷睿Ultra发布会官宣!迈向全新的AI时代
全新“AI助手”!讯飞星火助手中心人机协作共创新生态
中国联通发布图文AI大模型,可实现以文生图、视频剪辑
“图壤·阅读元宇宙”亮相北京国际图书博览会
WHEE网页地址入口
小米首次曝光 64 亿参数的 MiLM-6B AI 大模型,或将应用于小爱同学
兆讯传媒率先全面拥抱AI 数智广告内容焕发新生机