开启辅助访问 切换到宽版

精易论坛

 找回密码
 注册

QQ登录

只需一步,快速开始

用微信号发送消息登录论坛

新人指南 邀请好友注册 - 我关注人的新帖 教你赚取精币 - 每日签到


求职/招聘- 论坛接单- 开发者大厅

论坛版规 总版规 - 建议/投诉 - 应聘版主 - 精华帖总集 积分说明 - 禁言标准 - 有奖举报

查看: 634|回复: 3
收起左侧

[闲聊] 记录一种 查重偷鸡技巧

[复制链接]
发表于 2025-12-14 14:09:34 | 显示全部楼层 |阅读模式   浙江省金华市
假设有一个 超长字符串,希望给按行去重复
常规思路:-->  按行分割然后去重复。

按行分割(就用查找换行符或者直接分割文本)--效率低下
去重复(哈希表去重)--效率还行

偷鸡思路:
将字符串当作字节流处理(易语言是字节集或者是字符串指针逐个字符[因为易语言是ANSI字符串]),查找换行符  
然后优化 换行符 再windows下是 \r\n 也就是 字符(13)+字符(10).那么我们逐个字节搜索的时候直接搜13.然后跳过2个字符。(需要确保是win下的\r\n换行才适用)
剩下就是 优化哈希表的一些算法了。

更加激进的办法:
不真正分割 只扫描位置,得到每一行的开始位置和结束位置,读取出来查重后,返回的结果只保留位置信息。
比如  位置1-位置10  这一行是重复的 或者不是重复的 这样记录下来。
使用的时候从内存中真正读取回来。
速度就可以成倍数提升了。

结帖率:93% (13/14)

签到天数: 1 天

发表于 2025-12-14 23:13:21 | 显示全部楼层   比利时
我一般用strtok("\r\n"),不管他是\r还是\n,还是\r\n
回复 支持 反对

使用道具 举报

结帖率:100% (3/3)
发表于 2025-12-14 19:01:17 | 显示全部楼层   贵州省毕节市
恭喜你找到了正确姿势
回复 支持 反对

使用道具 举报

结帖率:91% (20/22)

签到天数: 1 天

发表于 2025-12-14 14:13:10 | 显示全部楼层   江西省赣州市

思路不错
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则 致发广告者

发布主题 收藏帖子 返回列表

sitemap| 易语言源码| 易语言教程| 易语言论坛| 易语言模块| 手机版| 广告投放| 精易论坛
拒绝任何人以任何形式在本论坛发表与中华人民共和国法律相抵触的言论,本站内容均为会员发表,并不代表精易立场!
论坛帖子内容仅用于技术交流学习和研究的目的,严禁用于非法目的,否则造成一切后果自负!如帖子内容侵害到你的权益,请联系我们!
防范网络诈骗,远离网络犯罪 违法和不良信息举报QQ: 793400750,邮箱:wp@125.la
网站简介:精易论坛成立于2009年,是一个程序设计学习交流技术论坛,隶属于揭阳市揭东区精易科技有限公司所有。
Powered by Discuz! X3.4 揭阳市揭东区精易科技有限公司 ( 粤ICP备2025452707号) 粤公网安备 44522102000125 增值电信业务经营许可证 粤B2-20192173

快速回复 返回顶部 返回列表