Team Ai
Modelpublic

dbernsohn/roberta-javascript

sourceHugging Faceupdated 5y agoView on Hugging Face
1likes49downloads
README.md45 linesDownload Raw Back to root
1# roberta-javascript2---3language: javascript4datasets:5- code_search_net6---7 8This is a [roberta](https://arxiv.org/pdf/1907.11692.pdf) pre-trained version on the [CodeSearchNet dataset](https://github.com/github/CodeSearchNet) for **javascript** Mask Language Model mission.9 10To load the model:11(necessary packages: !pip install transformers sentencepiece)12```python13from transformers import AutoTokenizer, AutoModelWithLMHead, pipeline14tokenizer = AutoTokenizer.from_pretrained("dbernsohn/roberta-javascript")15model = AutoModelWithLMHead.from_pretrained("dbernsohn/roberta-javascript")16 17fill_mask = pipeline(18    "fill-mask",19    model=model,20    tokenizer=tokenizer21)22```23 24You can then use this model to fill masked words in a Java code.25 26```python27code = """28var i;29for (i = 0; i < cars.<mask>; i++) {30  text += cars[i] + "<br>";31}32""".lstrip()33 34pred = {x["token_str"].replace("Ġ", ""): x["score"] for x in fill_mask(code)}35sorted(pred.items(), key=lambda kv: kv[1], reverse=True)36# [('length', 0.9959614872932434),37#  ('i', 0.00027875584783032537),38#  ('len', 0.0002283261710545048),39#  ('nodeType', 0.00013731322542298585),40#  ('index', 7.5289819505997e-05)]41```42 43The whole training process and hyperparameters are in my [GitHub repo](https://github.com/DorBernsohn/CodeLM/tree/main/CodeMLM)44 45> Created by [Dor Bernsohn](https://www.linkedin.com/in/dor-bernsohn-70b2b1146/)